Scaling Laws——参数、数据、算力的三角博弈
2018 年 GPT-1 只有 117M 参数,2024 年 DeepSeek-V3 膨胀到 671B——六年翻了 5700 倍。这个膨胀不是拍脑袋的结果。每一代模型的参数规模、训练数据量和 GPU 预算,背后都有一套经验规律在指导决策。
这套规律就是 Scaling Laws(缩放定律)——模型性能(通常以验证集 loss 衡量)随参数规模 N、训练数据量 D 和计算量 C 变化的幂律关系。它回答了一个根本问题:给定一个算力预算,怎么分配参数和数据才能得到最好的模型? 答案在 2020 到 2024 年间经历了三次重大修正,而这三次修正直接塑造了 GPT-3、Chinchilla、LLaMA 和 DeepSeek-V3 等里程碑模型的设计决策。
一、问题:算力有限时,该堆参数还是堆数据?
训练 LLM 的算力预算 C 近似为:
C ≈ 6 · N · D
其中 N 是参数量,D 是训练 token 数。给定一个固定的 C,你可以选择「大模型 + 少数据」或「小模型 + 多数据」——哪个更好?
对这个问题的不同回答,构成了三代 Scaling Laws 的分水岭。
二、第一代:Kaplan 定律——参数优先(OpenAI, 2020)
OpenAI 的 Kaplan 等人首次系统化地研究了 loss 与 N、D、C 的定量关系,拟合出经典的幂律公式:
L(N) = (N_c / N)^α_N 其中 α_N ≈ 0.076
L(D) = (D_c / D)^α_D 其中 α_D ≈ 0.095
L(C) = (C_c / C)^α_C 其中 α_C ≈ 0.050
核心结论是:模型越大,在同等算力下越「数据高效」——以 loss 下降速度衡量,增大参数量比增大数据量回报更高。这个结论直接驱动了 2020-2021 年的参数军备竞赛:GPT-3 (175B)、Gopher (280B)、MT-NLG (530B)——参数猛涨,但训练数据量增长有限。GPT-3 的 175B 参数只配了约 300B tokens,token/param 比仅为 1.7。
Kaplan 的洞见在当时是革命性的,但他的实验设计有一个后来被发现的盲区:学习率调度策略不统一。不同规模的模型使用了不同的学习率 schedule,导致小模型可能未被充分训练,从而在数据中呈现「大模型更高效」的假象。
三、第二代:Chinchilla 定律——数据与参数同比例增长(DeepMind, 2022)
DeepMind 的 Hoffmann 等人修正了 Kaplan 的实验缺陷——所有模型统一使用 cosine schedule 并训练到充分收敛——得出了截然相反的结论:
计算最优时:N_opt ∝ C^0.50,D_opt ∝ C^0.50
参数量和数据量应该同比例增长。 换算为工程经验法则:每个参数配约 20 个训练 token。
N_opt ≈ 0.6 · C^0.50
D_opt ≈ 0.4 · C^0.50
token 数 ≈ 20 × 参数量
他们用算力相等的一个对照实验戏剧性地证明了这一点:70B 的 Chinchilla(配 1.4T tokens)在几乎所有 Benchmark 上战胜了 280B 的 Gopher(配 300B tokens)。算力一样,但 Chinchilla 小 4 倍、数据多 4.7 倍——反而更强。
行业影响:2023 年以后几乎所有开源模型都走了 Chinchilla 路线。LLaMA 1 (65B/1.4T)、LLaMA 2 (70B/2T) 的 token/param 比分别达到 21.5 和 28.6——远超 GPT-3 的 1.7。
| 模型 | 参数量 | 训练数据 | token/param 比 |
|---|---|---|---|
| GPT-3 (2020) | 175B | ~300B | 1.7 |
| Chinchilla (2022) | 70B | 1.4T | 20 |
| LLaMA 1 (2023) | 65B | 1.4T | 21.5 |
| LLaMA 2 (2023) | 70B | 2T | 28.6 |
| LLaMA 3 (2024) | 405B | 15T+ | 37+ |
注意 2024 年的模型已突破 20:1 的比例——说明 Chinchilla 描述的是「计算最优」而非「数据上限」,更多数据仍在持续带来收益。
四、第三代:MoE——打破 N = N_active 的等式
混合专家模型(MoE)引入了一个新的自由度:总参数量 N_total 与每次前向激活的参数 N_active 不再相等。DeepSeek-V3 有 671B 总参数,但每次仅激活 37B——训练和推理的成本接近 37B 模型,而能力远超。
这给 Scaling Laws 增加了两个新维度:
| 变量 | 含义 | 对 Scaling 的影响 |
|---|---|---|
| E(专家总数) | 模型的总容量池 | E ↑ → 知识容量 ↑,成本近似不变 |
| K(激活专家数) | 每次前向参与计算的专家 | K ↑ → 计算量 ↑,路由复杂度 ↑ |
关键趋势:MoE 的 Scaling 曲线斜率比 Dense 模型更陡——同等算力增长,MoE 的 loss 下降更快。但存在一个最优的 K/E 比例——激活太多专家容易引发路由崩塌(token 全涌向少数专家,其余专家闲置)。
五、边界:经典 Scaling Laws 覆盖不到的地方
5.1 数据质量
经典 Scaling Laws 假设数据 i.i.d.——所有 token 价值相等。实际远非如此。研究显示 1 个高质量 token 的效果约等于 3-5 个随机网页 token。Phi 系列模型用精挑细选的合成数据,在小参数量上获得远超其规模的专项能力——这说明数据质量是 Scaling 公式中缺失的一个独立维度。
5.2 数据墙
Chinchilla 定律预言 10T 参数模型需要 ~200T tokens。但互联网高质量文本的总量估计仅 100T-300T token。这意味着数据墙将在下一两个数量级内成为真的约束——必须依靠合成数据、多模态数据或新的架构突破。
5.3 推理时间 Scaling
OpenAI o1/o3 和 DeepSeek-R1 开辟了 Scaling 的第三条轴:不 Scale 训练,Scale 推理。通过在推理阶段投入额外的计算(长 Chain-of-Thought),模型可以用时间换质量。这条轴不受参数和数据规模的限制,是当前最活跃的前沿方向。
六、对工程实践的意义
| 场景 | 关键原则 |
|---|---|
| 预训练 | 确保 token/param > 20;预算有限时优先保数据量而非参数量 |
| Fine-tune | Scaling Laws 不完全适用——小数据 + 高质量的效果远超公式预测 |
| 选型 | 同等参数下,训练 token 数更多的模型通常更强 |
| 判断天花板 | 看训练 loss 曲线——如果斜率还在下降,继续堆算力就还有收益 |
七、相关资源
- Kaplan et al., Scaling Laws for Neural Language Models (2020) — 第一代研究。
- Hoffmann et al., Training Compute-Optimal Large Language Models (Chinchilla, 2022) — 修正了 Kaplan 的核心结论。
- DeepSeek-AI, DeepSeek-V3 Technical Report (2024) — MoE Scaling Laws 的最新实践。
- LLM 架构演进史 — Scaling Laws 三次修正如何塑造了每一代模型的设计。