预训练 核心 约 22 分钟 更新 2026-10-02

Scaling Laws:参数、数据与算力的最优配比

学习状态:
未学

一句话定义

Scaling Laws 刻画了模型损失随参数量 N、数据量 D 与训练算力 C 幂律下降的规律,并回答「给定算力,参数与数据各用多少」的计算最优问题——2022 年 Chinchilla 结论是两者应大体等比例扩张(约每参数 20 词元,量级参考)。

为什么重要

Scaling Law 是过去数年「大力出奇迹」的定量依据,也是模型规划、算力预算、数据采购的决策工具。读懂它,你就能解释为什么各家模型尺寸与训练词元数如此安排、小模型用长训数据「蒸馏体力」的策略从何而来,也能识别「堆参数就行」这类说法的半对半错。

前置知识

核心概念

原理与机制

三变量关系可分解为:固定另外两个变量观察第三个的幂律;再在多个预算 C 下找各自最优 (N, D),拟合出 N_opt ∝ C^a、D_opt ∝ C^b 的标度关系。Chinchilla 估计 a ≈ b ≈ 0.5(量级),即算力翻倍时参数与数据各扩约 1.4 倍。幂律意味着:早期投入回报陡峭,越往后每十倍算力只换来固定额度的损失下降——这决定了「越大越强」成立但边际收益递减。

公式或模型

Kaplan 形式(简化):

L(N, D) = [ (N_c / N)^(α_N) + (D_c / D)^(α_D) ] 的单调组合 + L_∞

Chinchilla 计算最优近似:

N_opt ∝ C^0.5 , D_opt ∝ C^0.5 , D/N ≈ 20(词元/参数,经验量级)

图示

损失(log)
  │\
  │ \  幂律直线(log-log 下)
  │   \_
  │      \___ L∞ 不可约损失(数据熵决定)
  └──────────────────▶ 参数/数据/算力(log)

直观类比

像烘焙的「火候-时间-锅径」关系:锅越大(参数多),需要的食材越多(数据多),柴火也要等比例加(算力)。只换大锅不添料,烤出来的是夹生蛋糕——正是 Gopher 相对 Chinchilla 的处境。

实例或案例

Chinchilla(70B 参数,1.4T 词元)以约四分之一于 Gopher(280B)的训练算力取得更优损失与基准表现,直接改写了行业训练配方;此后「小参数 + 大量词元」路线(如多个 7B 级模型训练至数 T 词元)是部署导向对 Scaling Law 的偏离应用。

常见误区

与其他知识点的关系

自测题

  1. Chinchilla 相对 Kaplan 结论的核心修正是什么?
    答案要点:计算最优应同步扩张参数与数据(约等比例),而非优先扩参数。
  2. 为什么生产环境中模型常「欠训练参数、过训练数据」?
    答案要点:推理成本随参数增大而持续发生,小模型多喂数据可换取部署经济性。
  3. 幂律对投入决策的实践含义是什么?
    答案要点:边际收益递减,需在早期规划阶段用外推估算最优预算点。

延伸阅读