STEP 1
海量数据
互联网文本万亿 token
核心机制:Transformer 架构(2017, Google)
自注意力机制
每个词同时"看到"序列中所有其他词,自动学会哪些词之间有关联。让模型理解"他"指代谁、上下文如何相互影响。
规模定律 Scaling Law
模型参数越多 + 训练数据越多 + 计算越多 = 能力越强。这条"定律"驱动了GPT从1.17亿参数到万亿参数的指数增长。
涌现能力 Emergence
当模型规模超过临界点,突然"涌现"出之前没有的能力——如逻辑推理、代码编写、多步规划——无法被简单预测。