缩放法则
缩放法则(Scaling Laws) 揭示的是模型性能与「参数量、训练数据量、计算量」之间的可预测关系。它解释的是为什么持续加资源就能系统性提升性能,而不是撞上瓶颈。
两条法则与它们的分歧
Kaplan:参数比数据重要
Kaplan, J., et al. Scaling Laws for Neural Language Models. arXiv:2001.08361, 2020
在各自固定其他变量的前提下,损失与三个量的幂律关系是:
(
分配建议:把计算预算的增量中约 73% 给模型规模、27% 给训练数据 —— 也就是
它测的模型规模范围是 768M 到 1.5B 参数。
四条被称为「法则」的性质
| 性质 | 含义 |
|---|---|
| 平滑可预测 | 损失随规模连续下降,没有相变 |
| 可外推 | 可以训小模型、外推出 100 倍大的模型的损失——省掉昂贵的实验 |
| 量化了取舍 | 给定计算预算,能算出模型规模与训练时长的最优分配 |
| 架构不敏感 | 只要基于 Transformer,法则都成立——说明它反映的是从语言中学习的基本性质,不是架构特性 |
Chinchilla:模型和数据应该等比例扩
Hoffmann, J., et al. Training Compute-Optimal Large Language Models. arXiv:2203.07678, 2022(DeepMind)
这项工作训了 400+ 个语言模型,规模从 70M 到 16B 参数、5 到 500B 令牌,结论是:
对计算最优训练,模型规模和训练令牌数应该等比例扩——每翻倍模型规模,训练令牌也应该翻倍。
即
参数化的损失函数形式(两条法则都认同这个形式):
两条法则的分配指数不同,落到「参数规模 vs 训练令牌」这个平面上就是两条斜率不同的线。
参数量 N 训练令牌 D 令牌/参数比
Kaplan 2020 N ∝ C^0.73 D ∝ C^0.27 约 1.7 – 4
↑ 计算增量的约 73% 给参数规模、27% 给训练数据
↑ 测试范围:768M – 1.5B 参数
Chinchilla 2022 N ∝ C^0.50 D ∝ C^0.50 ~20(这组指数下的经验产物)
↑ 等比例扩:模型规模翻倍,训练令牌也翻倍
↑ 测试范围:400+ 个模型、70M – 16B 参数、5 – 500B 令牌
按下游的分歧:按 Kaplan 训出「参数更大、数据更少」的模型,
按 Chinchilla 训出「参数更小、数据更多」的模型。
同一个损失形式(两条法则都认同)
L(N, D) = E + A / N^α + B / D^β
E = 自然语言本身的不可约熵 —— 再大的模型也降不下去
Hoffmann 的拟合:α ≈ 0.34、β ≈ 0.28
「20 tokens/param」的地位:Hoffmann 拟合出 a ≈ 0.452、b ≈ 0.548,
两个指数接近但不相等 ──▶ 令牌/参数比按 C^{b−a} ≈ C^0.1 缓慢上漂
──▶ 它是那组特定指数在特定语料上的产物,不是普适常数「20 tokens per parameter」这条经验法则
它来自这一组拟合,但要说清它的地位:
Hoffmann 的分配指数是 a ≈ 0.452、b ≈ 0.548——接近但不相等。因为
「20 tokens/param」是那组特定指数在 Hoffmann 语料上的经验产物,不是普适常数。 不同模型家族与语料重新拟合会得到不同比值。
实用对照表:
| 模型规模 | Chinchilla 最优令牌 | 计算量 |
|---|---|---|
| 1B | 20B | 1.2 × 10²⁰ |
| 7B | 140B | 5.9 × 10²¹ |
| 13B | 260B | 2.0 × 10²² |
| 70B | 1.4T | 5.9 × 10²³ |
| 405B | 8.1T | 2.0 × 10²⁵ |
两者的分歧后来被解释清楚了
这是这一块最值得知道的后续工作——2024 年的和解研究发现分歧主要来自一个口径问题:
| 因素 | 影响 |
|---|---|
| 参数计数口径(最主要) | Kaplan 只数非嵌入参数,Hoffmann 数全部参数。小模型规模下嵌入参数(词表嵌入、位置嵌入)占总参数的比例可观,造成系统性偏差。用非嵌入参数在 Kaplan 的小规模上重分析 Chinchilla 的数据,得到 0.74–0.78,与 Kaplan 的 0.73 接近 |
| 实验规模 | Kaplan 最大 1.5B,Hoffmann 到 16B。非嵌入与总参数的关系有曲率,不同规模区间就得到不同的局部幂律拟合 |
| 学习率调度(较小) | Kaplan 用固定 cosine 周期长度;Hoffmann 认为 cosine 周期远超目标训练步数会导致训练不充分。但消融显示影响小于参数计数问题 |
结论:两条法则各自成立,它们是在不同口径与规模区间上的两次局部拟合。这解释了为什么两者看起来差那么多却都能各自成立。
Chinchilla 之后:行业为什么反过来「过度训练」
Chinchilla 优化的是训练计算。但推理计算才主导总成本。
一个小模型训得更久,服务成本更低。这个逻辑推到底,就是现代模型普遍故意偏离 Chinchilla 最优:
| 模型 | 参数量 | 训练令牌 | tokens/param |
|---|---|---|---|
| Chinchilla | 70B | 1.4T | ~20 |
| LLaMA-1 65B | 65B | 1.4T | ~21 |
| LLaMA-2 70B | 70B | 2T | ~29 |
| LLaMA-3 8B | 8B | 15T | ~1875 |
| LLaMA-3 70B | 70B | 15T | ~214 |
8B 模型训 15T 令牌——偏离 Chinchilla 近百倍。 现代部署常规过度训练 100 到 2000 倍。
Sardana et al. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. 2024 把这件事形式化了:在约 10 亿次推理请求的规模上,模型应该训得比 Chinchilla 处方小得多、久得多。
这条推翻了「Chinchilla 定律说 20 倍」这种简化读法:它说的只是「训练计算最优」,而总拥有成本的最优点在另一条曲线上。
Chinchilla 优化的是训练计算,而推理计算才主导总成本,于是实际模型普遍故意偏离它的处方。
tokens/param 的实际取值(对数刻度;条形按数值取对数,只用于看量级)
~20 ┤ ██ Chinchilla 70B
~21 ┤ ██ LLaMA-1 65B
~29 ┤ ███ LLaMA-2 70B
~214 ┤ ███████ LLaMA-3 70B
~1875 ┤ █████████████ LLaMA-3 8B(8B 训 15T 令牌)
│
└─ 偏离 Chinchilla 近百倍;现代部署常规过度训练 100 – 2000 倍
理由:小模型训得更久,服务成本更低。
在约 10 亿次推理请求的规模上,模型应该训得比 Chinchilla 处方
小得多、久得多。
数据墙给这条路设了上限(重复已有令牌的效果)
≤ ~4 个 epoch ┤███████████████ 重复几乎免费
> ~16 个 epoch ┤██ 收益崩溃
└─ 重复令牌的价值低于新令牌
└─ 参数与计算还能买,高质量人类文本买不到了
──▶ 数据质量与合成数据成为新的缩放杠杆数据墙
如果数据无限,上面的逻辑可以一直推下去。但数据是有限的:
Muennighoff et al. Scaling Data-Constrained Language Models. NeurIPS 2023
| 重复 epoch 数 | 效果 |
|---|---|
| ≤ ~4 | 几乎免费 |
| > ~16 | 收益崩溃 |
重复令牌的价值低于新令牌。 后果是数据质量与合成数据成为新的缩放杠杆——参数和计算还能买,高质量人类文本买不到了。
能力涌现,以及它引发的争议
观察到的现象
能力涌现(Emergent Abilities):当模型规模达到一定阈值后,突然展现出小规模模型中完全不存在、或表现很差的全新能力。
最直观的一条曲线是三位数加法:1B 参数约 0% → 10B 约 10% → 100B 约 90%+。
其他能力的阈值:
| 能力 | 大致涌现规模 |
|---|---|
| 上下文学习(少样本) | ~1B+ |
| 思维链推理 | ~10B+(提示有效约 60B+) |
| 多步算术 | ~50B+ |
| 代码生成 | ~10B+(可用)、~70B+(有竞争力) |
| 指令遵循 | ~7B+(对齐后)、~70B+(稳健) |
| 心智理论(简单) | ~100B+(有争议) |
争议:它可能是度量造成的假象
Schaeffer, Miranda, Sanborn. Are Emergent Abilities of Large Language Models a Mirage? NeurIPS 2023
核心论证:明显的相变主要是「不连续度量」的产物,不是底层损失的间断。
| 度量方式 | 观察到的形状 |
|---|---|
| 阈值型(精确字符串匹配:错=0、对=1) | 得到尖锐的相变 |
| 平滑型(token 级对数概率) | 改进是渐进的 |
证据:在精确匹配下显示「涌现」的那些任务上,换成平滑度量就显示平滑缩放。
诚实的结论是:两种观点都有道理。能力的改进是真实的;「转变是否真的不连续(在任何有用的意义上)」是有争议的。
交叉检验里还有一条相关的观察:不会零样本涌现的能力,可能已经存在、只是需要少样本示例就能取用。
对工程的含义分两句,都重要:
- 损失可以可靠预测——这才是缩放法则最扎实的部分
- 能力阈值要当作不确定的——可以用它做规划,不要把它当成硬边界
同一条损失曲线,换一种度量看就会得到两种形状。
损失(对数坐标)
│╲
│ ╲ 损失随规模连续下降、没有相变,而且可以从小模型
│ ╲ 外推到 100 倍大的模型 —— 这是缩放法则最扎实的部分
│ ╲
│ ╲╲
│ ╲╲╲
│ ╲╲╲╲╲
└───────────────────────────────▶ 规模(N / D / C)
同一段曲线,两种度量看到的能力曲线不同
阈值型度量(精确字符串匹配:错 = 0、对 = 1)
准确率 ┤
│ ╭───── 看起来像「相变」
│ ╭─────╯
│──────────────╯
└────────────────────────▶ 规模
平滑型度量(token 级对数概率)
对数概率 ┤
│ ╭────────── 改进是渐进的
│ ╭────╯
│╭──╯
└──────────────────────▶ 规模
证据:在精确匹配下显示「涌现」的那些任务,换成平滑度量就显示平滑缩放。
含义分两句 —— 损失可以可靠预测;能力阈值要当不确定的用,不要当硬边界。还在延伸的方向
缩放法则没有停在 2020–2022 那两篇:
| 工作 | 加了什么轴 |
|---|---|
Sharma & Kaplan 2020 | 从数据流形的内在维度出发,首次给出「为什么损失服从幂律」的第一性推导 |
Henighan et al. 2020 | 同样的幂律形式在图像、视频、数学、多模态领域都成立 |
Snell et al. Scaling LLM Test-Time Compute Optimally, 2024 | 测试时计算——证明测试时缩放能胜过 14 倍大的模型,是一条与训练规模正交的新轴 |
Kumar et al. Scaling Laws for Precision, 2024 | 精度轴(fp8 / fp4 训练与推理下的损失预测) |
| 2024–2026 的合并趋势 | 开始把预训练与测试时计算统一成一个联合预算 |
「测试时计算能胜过 14 倍大的模型」这条和 规划、CoT 与 Self-Consistency 是同一个故事——让模型多想一会儿,是在另一条轴上花计算。
缩放法则不止一条轴,后面加上来的几条与训练规模是正交的。
训练侧(2020 – 2022 的两条法则)
参数量 N ──┐
数据量 D ──┼─▶ 同一个损失形式 L(N, D) = E + A/N^α + B/D^β
计算量 C ──┘ C ≈ 6ND,所以前两项并不独立
之后加上来的轴
精度 fp8 / fp4 训练与推理下的损失预测(Kumar et al. 2024)
领域 同一幂律形式在图像、视频、数学、多模态都成立(Henighan et al. 2020)
测试时计算 让模型多想一会儿 —— 测试时缩放能胜过 14 倍大的模型(Snell et al. 2024)
第一性 从数据流形的内在维度出发,解释「为什么损失服从幂律」(Sharma & Kaplan 2020)
合并趋势 2024 – 2026 开始把预训练与测试时计算统一成一个联合预算
对选型的含义:测试时计算与训练规模是两条独立的轴 ——
「模型不够强」和「预算花在哪一侧」是两个问题。对智能体的直接含义
能力涌现意味着:要获得复杂自主决策与规划能力,前提是选一个足够大规模的模型。小模型上再怎么调提示也补不出这类能力,因为它们压根没跨越阈值。
但结合上面的争议,判据要写得再准一点:
- 可以用阈值做初步筛选(多步推理、规划这类能力在 10B–100B 这个量级开始可靠出现)
- 但最终要按任务实测——因为「阈值」本身是度量相关的,而你的任务用的是自己的度量
这一条直接进入模型选型的判据(见 08-模型选型)。
相关
- 08-模型选型 —— 这条法则在下游决策里的位置
- Prompt Engineering —— CoT 的规模依赖(低于约 100B 参数时反而有害)是涌现现象的直接后果
- 02-Transformer 架构 —— 法则对架构不敏感,前提是 Transformer
参考
- Kaplan, J., et al. Scaling Laws for Neural Language Models. arXiv:2001.08361, 2020.
- Hoffmann, J., et al. Training Compute-Optimal Large Language Models. arXiv:2203.07678, 2022.
- https://aiwiki.ai/wiki/scaling_laws_paper 、https://prakashkagitha.github.io/llm-stack-book/03-pretraining/04-scaling-laws.html
- https://theorempath.com/topics/scaling-laws
- https://engineersofai.com/docs/llms/transformer-architecture/scaling-laws
- https://karam-nus.github.io/language-modelling/32_scaling_laws.html
YJ