大语言模型:一切的核心引擎
STEP 1
海量数据
互联网文本万亿 token
STEP 2
预训练
预测下一个 token
STEP 3
对齐微调
RLHF / 人类反馈
STEP 4
推理部署
API / 本地化
OUTPUT
智能输出
文本/代码/图像
核心机制:Transformer 架构(2017, Google)
自注意力机制
每个词同时"看到"序列中所有其他词,自动学会哪些词之间有关联。让模型理解"他"指代谁、上下文如何相互影响。
规模定律 Scaling Law
模型参数越多 + 训练数据越多 + 计算越多 = 能力越强。这条"定律"驱动了GPT从1.17亿参数到万亿参数的指数增长。
涌现能力 Emergence
当模型规模超过临界点,突然"涌现"出之前没有的能力——如逻辑推理、代码编写、多步规划——无法被简单预测。
1.8万亿
GPT-4 推测参数量
13万亿
训练 token 数量级
$100M+
单次训练成本估算
2 个月
ChatGPT 破亿用户
08