Skip to content

缩放法则 ​

标签
AI/llm
字数
3599 字
阅读时间
15 分钟

缩放法则(Scaling Laws) 揭示的是模型性能与「参数量、训练数据量、计算量」之间的可预测关系。它解释的是为什么持续加资源就能系统性提升性能,而不是撞上瓶颈。

两条法则与它们的分歧 ​

Kaplan:参数比数据重要 ​

Kaplan, J., et al. Scaling Laws for Neural Language Models. arXiv:2001.08361, 2020

在各自固定其他变量的前提下,损失与三个量的幂律关系是:

L∝N−0.076,L∝D−0.095,L∝C−0.050

(N 参数量、D 训练令牌数、C 计算预算)

分配建议:把计算预算的增量中约 73% 给模型规模、27% 给训练数据 —— 也就是 Nopt∝C0.73、Dopt∝C0.27。对应的令牌/参数比约 1.7 到 4。

它测的模型规模范围是 768M 到 1.5B 参数。

四条被称为「法则」的性质 ​

性质含义
平滑可预测损失随规模连续下降,没有相变
可外推可以训小模型、外推出 100 倍大的模型的损失——省掉昂贵的实验
量化了取舍给定计算预算,能算出模型规模与训练时长的最优分配
架构不敏感只要基于 Transformer,法则都成立——说明它反映的是从语言中学习的基本性质,不是架构特性

Chinchilla:模型和数据应该等比例扩 ​

Hoffmann, J., et al. Training Compute-Optimal Large Language Models. arXiv:2203.07678, 2022(DeepMind)

这项工作训了 400+ 个语言模型,规模从 70M 到 16B 参数、5 到 500B 令牌,结论是:

对计算最优训练,模型规模和训练令牌数应该等比例扩——每翻倍模型规模,训练令牌也应该翻倍。

即 Nopt∝C0.50、Dopt∝C0.50。

参数化的损失函数形式(两条法则都认同这个形式):

L(N,D)=E+ANα+BDβ

E 是自然语言本身的不可约熵——再大的模型也降不下去的那部分。Hoffmann 的拟合给出 α ≈ 0.34、β ≈ 0.28。

两条法则的分配指数不同,落到「参数规模 vs 训练令牌」这个平面上就是两条斜率不同的线。

                  参数量 N         训练令牌 D        令牌/参数比
Kaplan 2020       N ∝ C^0.73       D ∝ C^0.27       约 1.7 – 4
   ↑ 计算增量的约 73% 给参数规模、27% 给训练数据
   ↑ 测试范围:768M – 1.5B 参数

Chinchilla 2022   N ∝ C^0.50       D ∝ C^0.50       ~20(这组指数下的经验产物)
   ↑ 等比例扩:模型规模翻倍,训练令牌也翻倍
   ↑ 测试范围:400+ 个模型、70M – 16B 参数、5 – 500B 令牌

按下游的分歧:按 Kaplan 训出「参数更大、数据更少」的模型,
按 Chinchilla 训出「参数更小、数据更多」的模型。

同一个损失形式(两条法则都认同)
      L(N, D) = E + A / N^α + B / D^β
      E = 自然语言本身的不可约熵 —— 再大的模型也降不下去
      Hoffmann 的拟合:α ≈ 0.34、β ≈ 0.28

「20 tokens/param」的地位:Hoffmann 拟合出 a ≈ 0.452、b ≈ 0.548,
      两个指数接近但不相等 ──▶ 令牌/参数比按 C^{b−a} ≈ C^0.1 缓慢上漂
      ──▶ 它是那组特定指数在特定语料上的产物,不是普适常数

「20 tokens per parameter」这条经验法则 ​

它来自这一组拟合,但要说清它的地位:

Hoffmann 的分配指数是 a ≈ 0.452、b ≈ 0.548——接近但不相等。因为 b>a,令牌/参数比会随计算量缓慢上漂(按 Cb−a≈C0.1),而不是固定不变。

「20 tokens/param」是那组特定指数在 Hoffmann 语料上的经验产物,不是普适常数。 不同模型家族与语料重新拟合会得到不同比值。

实用对照表:

模型规模Chinchilla 最优令牌计算量 C≈6ND
1B20B1.2 × 10²⁰
7B140B5.9 × 10²¹
13B260B2.0 × 10²²
70B1.4T5.9 × 10²³
405B8.1T2.0 × 10²⁵

两者的分歧后来被解释清楚了 ​

这是这一块最值得知道的后续工作——2024 年的和解研究发现分歧主要来自一个口径问题:

因素影响
参数计数口径(最主要)Kaplan 只数非嵌入参数,Hoffmann 数全部参数。小模型规模下嵌入参数(词表嵌入、位置嵌入)占总参数的比例可观,造成系统性偏差。用非嵌入参数在 Kaplan 的小规模上重分析 Chinchilla 的数据,得到 0.74–0.78,与 Kaplan 的 0.73 接近
实验规模Kaplan 最大 1.5B,Hoffmann 到 16B。非嵌入与总参数的关系有曲率,不同规模区间就得到不同的局部幂律拟合
学习率调度(较小)Kaplan 用固定 cosine 周期长度;Hoffmann 认为 cosine 周期远超目标训练步数会导致训练不充分。但消融显示影响小于参数计数问题

结论:两条法则各自成立,它们是在不同口径与规模区间上的两次局部拟合。这解释了为什么两者看起来差那么多却都能各自成立。

Chinchilla 之后:行业为什么反过来「过度训练」 ​

Chinchilla 优化的是训练计算。但推理计算才主导总成本。

一个小模型训得更久,服务成本更低。这个逻辑推到底,就是现代模型普遍故意偏离 Chinchilla 最优:

模型参数量训练令牌tokens/param
Chinchilla70B1.4T~20
LLaMA-1 65B65B1.4T~21
LLaMA-2 70B70B2T~29
LLaMA-3 8B8B15T~1875
LLaMA-3 70B70B15T~214

8B 模型训 15T 令牌——偏离 Chinchilla 近百倍。 现代部署常规过度训练 100 到 2000 倍。

Sardana et al. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. 2024 把这件事形式化了:在约 10 亿次推理请求的规模上,模型应该训得比 Chinchilla 处方小得多、久得多。

这条推翻了「Chinchilla 定律说 20 倍」这种简化读法:它说的只是「训练计算最优」,而总拥有成本的最优点在另一条曲线上。

Chinchilla 优化的是训练计算,而推理计算才主导总成本,于是实际模型普遍故意偏离它的处方。

tokens/param 的实际取值(对数刻度;条形按数值取对数,只用于看量级)

   ~20 ┤ ██                                       Chinchilla 70B
   ~21 ┤ ██                                       LLaMA-1 65B
   ~29 ┤ ███                                      LLaMA-2 70B
  ~214 ┤ ███████                                  LLaMA-3 70B
 ~1875 ┤ █████████████                          LLaMA-3 8B(8B 训 15T 令牌)
       │
       └─ 偏离 Chinchilla 近百倍;现代部署常规过度训练 100 – 2000 倍
          理由:小模型训得更久,服务成本更低。
          在约 10 亿次推理请求的规模上,模型应该训得比 Chinchilla 处方
          小得多、久得多。

数据墙给这条路设了上限(重复已有令牌的效果)
  ≤ ~4 个 epoch   ┤███████████████   重复几乎免费
  > ~16 个 epoch  ┤██                收益崩溃
                  └─ 重复令牌的价值低于新令牌
                  └─ 参数与计算还能买,高质量人类文本买不到了
                     ──▶ 数据质量与合成数据成为新的缩放杠杆

数据墙 ​

如果数据无限,上面的逻辑可以一直推下去。但数据是有限的:

Muennighoff et al. Scaling Data-Constrained Language Models. NeurIPS 2023

重复 epoch 数效果
≤ ~4几乎免费
> ~16收益崩溃

重复令牌的价值低于新令牌。 后果是数据质量与合成数据成为新的缩放杠杆——参数和计算还能买,高质量人类文本买不到了。

能力涌现,以及它引发的争议 ​

观察到的现象 ​

能力涌现(Emergent Abilities):当模型规模达到一定阈值后,突然展现出小规模模型中完全不存在、或表现很差的全新能力。

最直观的一条曲线是三位数加法:1B 参数约 0% → 10B 约 10% → 100B 约 90%+。

其他能力的阈值:

能力大致涌现规模
上下文学习(少样本)~1B+
思维链推理~10B+(提示有效约 60B+)
多步算术~50B+
代码生成~10B+(可用)、~70B+(有竞争力)
指令遵循~7B+(对齐后)、~70B+(稳健)
心智理论(简单)~100B+(有争议)

争议:它可能是度量造成的假象 ​

Schaeffer, Miranda, Sanborn. Are Emergent Abilities of Large Language Models a Mirage? NeurIPS 2023

核心论证:明显的相变主要是「不连续度量」的产物,不是底层损失的间断。

度量方式观察到的形状
阈值型(精确字符串匹配:错=0、对=1)得到尖锐的相变
平滑型(token 级对数概率)改进是渐进的

证据:在精确匹配下显示「涌现」的那些任务上,换成平滑度量就显示平滑缩放。

诚实的结论是:两种观点都有道理。能力的改进是真实的;「转变是否真的不连续(在任何有用的意义上)」是有争议的。

交叉检验里还有一条相关的观察:不会零样本涌现的能力,可能已经存在、只是需要少样本示例就能取用。

对工程的含义分两句,都重要:

  • 损失可以可靠预测——这才是缩放法则最扎实的部分
  • 能力阈值要当作不确定的——可以用它做规划,不要把它当成硬边界

同一条损失曲线,换一种度量看就会得到两种形状。

损失(对数坐标)
  │╲
  │ ╲     损失随规模连续下降、没有相变,而且可以从小模型
  │  ╲    外推到 100 倍大的模型 —— 这是缩放法则最扎实的部分
  │   ╲
  │    ╲╲
  │      ╲╲╲
  │          ╲╲╲╲╲
  └───────────────────────────────▶ 规模(N / D / C)

同一段曲线,两种度量看到的能力曲线不同

  阈值型度量(精确字符串匹配:错 = 0、对 = 1)
      准确率 ┤
             │                    ╭─────  看起来像「相变」
             │              ╭─────╯
             │──────────────╯
             └────────────────────────▶ 规模

  平滑型度量(token 级对数概率)
      对数概率 ┤
               │        ╭──────────   改进是渐进的
               │   ╭────╯
               │╭──╯
               └──────────────────────▶ 规模

证据:在精确匹配下显示「涌现」的那些任务,换成平滑度量就显示平滑缩放。
含义分两句 —— 损失可以可靠预测;能力阈值要当不确定的用,不要当硬边界。

还在延伸的方向 ​

缩放法则没有停在 2020–2022 那两篇:

工作加了什么轴
Sharma & Kaplan 2020从数据流形的内在维度出发,首次给出「为什么损失服从幂律」的第一性推导
Henighan et al. 2020同样的幂律形式在图像、视频、数学、多模态领域都成立
Snell et al. Scaling LLM Test-Time Compute Optimally, 2024测试时计算——证明测试时缩放能胜过 14 倍大的模型,是一条与训练规模正交的新轴
Kumar et al. Scaling Laws for Precision, 2024精度轴(fp8 / fp4 训练与推理下的损失预测)
2024–2026 的合并趋势开始把预训练与测试时计算统一成一个联合预算

「测试时计算能胜过 14 倍大的模型」这条和 规划、CoT 与 Self-Consistency 是同一个故事——让模型多想一会儿,是在另一条轴上花计算。

缩放法则不止一条轴,后面加上来的几条与训练规模是正交的。

训练侧(2020 – 2022 的两条法则)
  参数量 N ──┐
  数据量 D ──┼─▶ 同一个损失形式 L(N, D) = E + A/N^α + B/D^β
  计算量 C ──┘   C ≈ 6ND,所以前两项并不独立

之后加上来的轴
  精度        fp8 / fp4 训练与推理下的损失预测(Kumar et al. 2024)
  领域        同一幂律形式在图像、视频、数学、多模态都成立(Henighan et al. 2020)
  测试时计算  让模型多想一会儿 —— 测试时缩放能胜过 14 倍大的模型(Snell et al. 2024)
  第一性      从数据流形的内在维度出发,解释「为什么损失服从幂律」(Sharma & Kaplan 2020)
  合并趋势    2024 – 2026 开始把预训练与测试时计算统一成一个联合预算

对选型的含义:测试时计算与训练规模是两条独立的轴 ——
「模型不够强」和「预算花在哪一侧」是两个问题。

对智能体的直接含义 ​

能力涌现意味着:要获得复杂自主决策与规划能力,前提是选一个足够大规模的模型。小模型上再怎么调提示也补不出这类能力,因为它们压根没跨越阈值。

但结合上面的争议,判据要写得再准一点:

  • 可以用阈值做初步筛选(多步推理、规划这类能力在 10B–100B 这个量级开始可靠出现)
  • 但最终要按任务实测——因为「阈值」本身是度量相关的,而你的任务用的是自己的度量

这一条直接进入模型选型的判据(见 08-模型选型)。

相关 ​

参考 ​

贡献者 ​

文件历史 ​