一句话定义
后训练(Post-Training)把只会续写的基座模型改造成可用助手,标准范式是三阶段:监督微调(SFT)建立指令行为,偏好训练(RLHF/DPO)对齐人类偏好,可选的持续迭代将安全与能力打磨到可发布状态。
为什么重要
「基座模型 ≠ 可用产品」是本领域的核心分界线。InstructGPT 论文(2022)用一个 1.3B 对齐模型在人类偏好上胜过 175B 基座的实验,确立了对齐优先于规模的行业认知。理解三阶段框架,就能把散落的 SFT、RLHF、DPO、安全训练等概念各归其位。
前置知识
- kp-005(预训练目标与损失)
核心概念
- 对齐(Alignment):让模型行为符合人类意图与价值——有用(Helpful)、诚实(Honest)、无害(Harmless),即所谓 3H 目标。
- 阶段一 SFT:人工撰写或筛选的高质量指令-回答对做监督训练,教会「对话格式与行为模式」。
- 阶段二 偏好优化:收集人类对多个回答的偏好排序,用 RLHF(奖励模型 + 强化学习)或 DPO 直接优化。
- 安全训练:红队测试驱动的拒答与边界行为训练,常与阶段二交织进行。
- 对齐税(Alignment Tax):对齐过程中通用能力可能轻微下降的代价。
- 奖励作弊(Reward Hacking):模型钻奖励模型空子获高分但实际质量差的现象。
原理与机制
预训练分布是「互联网文本」,其中助手式回答占比极低,基座模型因此「会答但不会好好答」。SFT 用少量精标数据(早期 InstructGPT 约万级标注,量级参考)完成行为格式化;但「好答案」难以逐字标注,只能通过「比较」表达——偏好信号应运而生:RLHF 先训练奖励模型替人打分,再用 PPO 最大化奖励并约束不偏离 SFT 模型过远;DPO 则跳过显式奖励模型(见 kp-019)。三阶段的本质是逐级缩小模型行为分布与人类期望分布的差距。
公式或模型
三阶段在优化目标上的位置(直观化):
图示
基座模型(会续写)
│ ① SFT: 指令-示范对 → 会对话、会遵循格式
│ ② RLHF / DPO: 偏好数据 → 回答更合意、安全边界清晰
│ ③ 迭代评估与安全打磨 → 可发布
▼
对话模型(助手)
直观类比
基座模型像「饱读诗书但没上过班的毕业生」:知识丰富却不懂职场规矩。SFT 是入职培训(学流程与格式),偏好优化是绩效反馈(告诉你哪种做法更受欢迎),安全训练是合规培训(红线不可越)。三层叠加才成为合格员工。
实例或案例
InstructGPT(2022)系统化提出三阶段并给出「小模型胜大基座」的证据;ChatGPT 即该范式的产品化;Constitutional AI(2022)提出用一组原则让 AI 反馈替代部分人工标注,展示了「对齐数据来源」的演化方向。各家后续发布的助手模型基本沿此框架做工程改良。
常见误区
- 「对齐让模型变聪明」:对齐改变行为分布,不注入预训练没有的知识;它让能力「可用」而非「更强」。
- 「三阶段必须严格串行」:实践中常迭代交叉(如 SFT 与偏好数据多轮交替),框架是概念性的。
- 「对齐是一次性的」:新能力、新风险出现后需持续评估与再对齐。
与其他知识点的关系
自测题
- 为什么基座模型「会答但不会好好答」?答案要点:预训练语料中助手式回答占比低,行为分布不对;需 SFT 格式化 + 偏好优化。
- 为什么要用「偏好比较」而不是逐字标注好答案?答案要点:高质量回答难以穷举式书写,人类更擅长判断优劣(比较成本低、信号可靠)。
- 什么是奖励作弊?它的根源是什么?答案要点:模型优化奖励模型的评分而非真实质量;根源是奖励模型只是人类偏好的不完美代理。
延伸阅读
- Training language models to follow instructions with human feedback(Ouyang 等,2022):InstructGPT
- Constitutional AI(Bai 等,2022)