一句话定义
Scaling Laws 刻画了模型损失随参数量 N、数据量 D 与训练算力 C 幂律下降的规律,并回答「给定算力,参数与数据各用多少」的计算最优问题——2022 年 Chinchilla 结论是两者应大体等比例扩张(约每参数 20 词元,量级参考)。
为什么重要
Scaling Law 是过去数年「大力出奇迹」的定量依据,也是模型规划、算力预算、数据采购的决策工具。读懂它,你就能解释为什么各家模型尺寸与训练词元数如此安排、小模型用长训数据「蒸馏体力」的策略从何而来,也能识别「堆参数就行」这类说法的半对半错。
前置知识
- kp-005(预训练损失是什么)
核心概念
- 幂律:损失 L 关于 N、D、C 呈 L = a·x^(-α) + 不可约项的光滑下降,跨多个数量级成立。
- 计算最优(Compute-Optimal):给定算力预算 C,使损失最小的 (N, D) 组合。
- Chinchilla 修正:Kaplan 等认为应优先扩参数;Chinchilla(Hoffmann 等,2022)用更系统的实验证明应同步扩数据,原 Gopher 级模型「参数过量、数据不足」。
- 推理代价权衡:训练计算最优 ≠ 部署最优;服务量大的模型宁可欠训练(参数偏小)以省推理成本。
- 过训练(Over-training):小模型用远超计算最优的数据量训练,换取部署效率(如多个轻量级模型的做法)。
原理与机制
三变量关系可分解为:固定另外两个变量观察第三个的幂律;再在多个预算 C 下找各自最优 (N, D),拟合出 N_opt ∝ C^a、D_opt ∝ C^b 的标度关系。Chinchilla 估计 a ≈ b ≈ 0.5(量级),即算力翻倍时参数与数据各扩约 1.4 倍。幂律意味着:早期投入回报陡峭,越往后每十倍算力只换来固定额度的损失下降——这决定了「越大越强」成立但边际收益递减。
公式或模型
Kaplan 形式(简化):
L(N, D) = [ (N_c / N)^(α_N) + (D_c / D)^(α_D) ] 的单调组合 + L_∞
Chinchilla 计算最优近似:
N_opt ∝ C^0.5 , D_opt ∝ C^0.5 , D/N ≈ 20(词元/参数,经验量级)
图示
损失(log)
│\
│ \ 幂律直线(log-log 下)
│ \_
│ \___ L∞ 不可约损失(数据熵决定)
└──────────────────▶ 参数/数据/算力(log)
直观类比
像烘焙的「火候-时间-锅径」关系:锅越大(参数多),需要的食材越多(数据多),柴火也要等比例加(算力)。只换大锅不添料,烤出来的是夹生蛋糕——正是 Gopher 相对 Chinchilla 的处境。
实例或案例
Chinchilla(70B 参数,1.4T 词元)以约四分之一于 Gopher(280B)的训练算力取得更优损失与基准表现,直接改写了行业训练配方;此后「小参数 + 大量词元」路线(如多个 7B 级模型训练至数 T 词元)是部署导向对 Scaling Law 的偏离应用。
常见误区
- 「Scaling Law 保证更大的模型必然更好」:前提是数据同步扩足且质量不降;数据受限时曲线提前弯折。
- 「参数量是模型实力的唯一指标」:训练词元数、数据质量、后训练同样重要,比参数不看训练配方是常见误读。
- 「Chinchilla 比例是金科玉律」:它是训练侧的最优解,考虑推理成本后业界普遍故意偏离。
与其他知识点的关系
- kp-006 决定公式中的 D 如何获得;kp-008 是把 C 变成现实训练的工程;kp-033 讨论涌现与 Scaling Law 的争议;kp-015 的 MoE 是另一种「参数换算力」的规模化思路。
自测题
- Chinchilla 相对 Kaplan 结论的核心修正是什么?答案要点:计算最优应同步扩张参数与数据(约等比例),而非优先扩参数。
- 为什么生产环境中模型常「欠训练参数、过训练数据」?答案要点:推理成本随参数增大而持续发生,小模型多喂数据可换取部署经济性。
- 幂律对投入决策的实践含义是什么?答案要点:边际收益递减,需在早期规划阶段用外推估算最优预算点。
延伸阅读
- Scaling Laws for Neural Language Models(Kaplan 等,2020)
- Training Compute-Optimal Large Language Models(Hoffmann 等,2022):Chinchilla