后训练与对齐 核心 约 15 分钟 更新 2026-10-02

从预训练到对齐:后训练三阶段总览

学习状态:
未学

一句话定义

后训练(Post-Training)把只会续写的基座模型改造成可用助手,标准范式是三阶段:监督微调(SFT)建立指令行为,偏好训练(RLHF/DPO)对齐人类偏好,可选的持续迭代将安全与能力打磨到可发布状态。

为什么重要

「基座模型 ≠ 可用产品」是本领域的核心分界线。InstructGPT 论文(2022)用一个 1.3B 对齐模型在人类偏好上胜过 175B 基座的实验,确立了对齐优先于规模的行业认知。理解三阶段框架,就能把散落的 SFT、RLHF、DPO、安全训练等概念各归其位。

前置知识

核心概念

原理与机制

预训练分布是「互联网文本」,其中助手式回答占比极低,基座模型因此「会答但不会好好答」。SFT 用少量精标数据(早期 InstructGPT 约万级标注,量级参考)完成行为格式化;但「好答案」难以逐字标注,只能通过「比较」表达——偏好信号应运而生:RLHF 先训练奖励模型替人打分,再用 PPO 最大化奖励并约束不偏离 SFT 模型过远;DPO 则跳过显式奖励模型(见 kp-019)。三阶段的本质是逐级缩小模型行为分布与人类期望分布的差距。

公式或模型

三阶段在优化目标上的位置(直观化):

预训练: min −log P(互联网文本)
SFT: min −log P(示范回答 | 指令)
偏好: max E[人类偏好胜率] (经由奖励模型或直接策略,见 kp-018/019)

图示

基座模型(会续写)
   │ ① SFT: 指令-示范对           → 会对话、会遵循格式
   │ ② RLHF / DPO: 偏好数据       → 回答更合意、安全边界清晰
   │ ③ 迭代评估与安全打磨          → 可发布
   ▼
对话模型(助手)

直观类比

基座模型像「饱读诗书但没上过班的毕业生」:知识丰富却不懂职场规矩。SFT 是入职培训(学流程与格式),偏好优化是绩效反馈(告诉你哪种做法更受欢迎),安全训练是合规培训(红线不可越)。三层叠加才成为合格员工。

实例或案例

InstructGPT(2022)系统化提出三阶段并给出「小模型胜大基座」的证据;ChatGPT 即该范式的产品化;Constitutional AI(2022)提出用一组原则让 AI 反馈替代部分人工标注,展示了「对齐数据来源」的演化方向。各家后续发布的助手模型基本沿此框架做工程改良。

常见误区

与其他知识点的关系

自测题

  1. 为什么基座模型「会答但不会好好答」?
    答案要点:预训练语料中助手式回答占比低,行为分布不对;需 SFT 格式化 + 偏好优化。
  2. 为什么要用「偏好比较」而不是逐字标注好答案?
    答案要点:高质量回答难以穷举式书写,人类更擅长判断优劣(比较成本低、信号可靠)。
  3. 什么是奖励作弊?它的根源是什么?
    答案要点:模型优化奖励模型的评分而非真实质量;根源是奖励模型只是人类偏好的不完美代理。

延伸阅读