Scaling Laws——参数、数据、算力的三角博弈

2018 年 GPT-1 只有 117M 参数,2024 年 DeepSeek-V3 膨胀到 671B——六年翻了 5700 倍。这个膨胀不是拍脑袋的结果。每一代模型的参数规模、训练数据量和 GPU 预算,背后都有一套经验规律在指导决策。

这套规律就是 Scaling Laws(缩放定律)——模型性能(通常以验证集 loss 衡量)随参数规模 N、训练数据量 D 和计算量 C 变化的幂律关系。它回答了一个根本问题:给定一个算力预算,怎么分配参数和数据才能得到最好的模型? 答案在 2020 到 2024 年间经历了三次重大修正,而这三次修正直接塑造了 GPT-3、Chinchilla、LLaMA 和 DeepSeek-V3 等里程碑模型的设计决策。


一、问题:算力有限时,该堆参数还是堆数据?

训练 LLM 的算力预算 C 近似为:

C ≈ 6 · N · D

其中 N 是参数量,D 是训练 token 数。给定一个固定的 C,你可以选择「大模型 + 少数据」或「小模型 + 多数据」——哪个更好?

对这个问题的不同回答,构成了三代 Scaling Laws 的分水岭。


二、第一代:Kaplan 定律——参数优先(OpenAI, 2020)

OpenAI 的 Kaplan 等人首次系统化地研究了 loss 与 N、D、C 的定量关系,拟合出经典的幂律公式:

L(N) = (N_c / N)^α_N      其中 α_N ≈ 0.076
L(D) = (D_c / D)^α_D      其中 α_D ≈ 0.095
L(C) = (C_c / C)^α_C      其中 α_C ≈ 0.050

核心结论是:模型越大,在同等算力下越「数据高效」——以 loss 下降速度衡量,增大参数量比增大数据量回报更高。这个结论直接驱动了 2020-2021 年的参数军备竞赛:GPT-3 (175B)、Gopher (280B)、MT-NLG (530B)——参数猛涨,但训练数据量增长有限。GPT-3 的 175B 参数只配了约 300B tokens,token/param 比仅为 1.7。

Kaplan 的洞见在当时是革命性的,但他的实验设计有一个后来被发现的盲区:学习率调度策略不统一。不同规模的模型使用了不同的学习率 schedule,导致小模型可能未被充分训练,从而在数据中呈现「大模型更高效」的假象。


三、第二代:Chinchilla 定律——数据与参数同比例增长(DeepMind, 2022)

DeepMind 的 Hoffmann 等人修正了 Kaplan 的实验缺陷——所有模型统一使用 cosine schedule 并训练到充分收敛——得出了截然相反的结论:

计算最优时:N_opt ∝ C^0.50,D_opt ∝ C^0.50

参数量和数据量应该同比例增长。 换算为工程经验法则:每个参数配约 20 个训练 token。

N_opt ≈ 0.6 · C^0.50
D_opt ≈ 0.4 · C^0.50
token 数 ≈ 20 × 参数量

他们用算力相等的一个对照实验戏剧性地证明了这一点:70B 的 Chinchilla(配 1.4T tokens)在几乎所有 Benchmark 上战胜了 280B 的 Gopher(配 300B tokens)。算力一样,但 Chinchilla 小 4 倍、数据多 4.7 倍——反而更强。

行业影响:2023 年以后几乎所有开源模型都走了 Chinchilla 路线。LLaMA 1 (65B/1.4T)、LLaMA 2 (70B/2T) 的 token/param 比分别达到 21.5 和 28.6——远超 GPT-3 的 1.7。

模型 参数量 训练数据 token/param 比
GPT-3 (2020) 175B ~300B 1.7
Chinchilla (2022) 70B 1.4T 20
LLaMA 1 (2023) 65B 1.4T 21.5
LLaMA 2 (2023) 70B 2T 28.6
LLaMA 3 (2024) 405B 15T+ 37+

注意 2024 年的模型已突破 20:1 的比例——说明 Chinchilla 描述的是「计算最优」而非「数据上限」,更多数据仍在持续带来收益。


四、第三代:MoE——打破 N = N_active 的等式

混合专家模型(MoE)引入了一个新的自由度:总参数量 N_total 与每次前向激活的参数 N_active 不再相等。DeepSeek-V3 有 671B 总参数,但每次仅激活 37B——训练和推理的成本接近 37B 模型,而能力远超。

这给 Scaling Laws 增加了两个新维度:

变量 含义 对 Scaling 的影响
E(专家总数) 模型的总容量池 E ↑ → 知识容量 ↑,成本近似不变
K(激活专家数) 每次前向参与计算的专家 K ↑ → 计算量 ↑,路由复杂度 ↑

关键趋势:MoE 的 Scaling 曲线斜率比 Dense 模型更陡——同等算力增长,MoE 的 loss 下降更快。但存在一个最优的 K/E 比例——激活太多专家容易引发路由崩塌(token 全涌向少数专家,其余专家闲置)。


五、边界:经典 Scaling Laws 覆盖不到的地方

5.1 数据质量

经典 Scaling Laws 假设数据 i.i.d.——所有 token 价值相等。实际远非如此。研究显示 1 个高质量 token 的效果约等于 3-5 个随机网页 token。Phi 系列模型用精挑细选的合成数据,在小参数量上获得远超其规模的专项能力——这说明数据质量是 Scaling 公式中缺失的一个独立维度。

5.2 数据墙

Chinchilla 定律预言 10T 参数模型需要 ~200T tokens。但互联网高质量文本的总量估计仅 100T-300T token。这意味着数据墙将在下一两个数量级内成为真的约束——必须依靠合成数据、多模态数据或新的架构突破。

5.3 推理时间 Scaling

OpenAI o1/o3 和 DeepSeek-R1 开辟了 Scaling 的第三条轴:不 Scale 训练,Scale 推理。通过在推理阶段投入额外的计算(长 Chain-of-Thought),模型可以用时间换质量。这条轴不受参数和数据规模的限制,是当前最活跃的前沿方向。


六、对工程实践的意义

场景 关键原则
预训练 确保 token/param > 20;预算有限时优先保数据量而非参数量
Fine-tune Scaling Laws 不完全适用——小数据 + 高质量的效果远超公式预测
选型 同等参数下,训练 token 数更多的模型通常更强
判断天花板 看训练 loss 曲线——如果斜率还在下降,继续堆算力就还有收益

七、相关资源

  • Kaplan et al., Scaling Laws for Neural Language Models (2020) — 第一代研究。
  • Hoffmann et al., Training Compute-Optimal Large Language Models (Chinchilla, 2022) — 修正了 Kaplan 的核心结论。
  • DeepSeek-AI, DeepSeek-V3 Technical Report (2024) — MoE Scaling Laws 的最新实践。
  • LLM 架构演进史 — Scaling Laws 三次修正如何塑造了每一代模型的设计。