一句话定义
RLHF(Reinforcement Learning from Human Feedback)先用人类偏好数据训练一个奖励模型来「替人打分」,再用强化学习(通常是 PPO)优化语言模型策略使其输出获得更高奖励,同时被约束不偏离初始模型过远。
为什么重要
RLHF 是 ChatGPT 时代的关键技术标签,把「人类觉得好」首次变成可优化的标量信号。理解它,才能理解 DPO 等后续方法在优化什么、简化了什么;也才能识别奖励作弊、对齐税等真实工程问题的根源。
前置知识
- kp-017(SFT 与对话模型)
核心概念
- 偏好数据:同一提示下多个回答,人类标注哪个更好(成对比较为主,比绝对打分可靠)。
- 奖励模型(RM,Reward Model):以语言模型为骨干、输出标量分的回归模型,学习拟合人类偏好。
- PPO(Proximal Policy Optimization):策略梯度算法,通过裁剪目标限制单步更新幅度,训练稳定。
- KL 惩罚:对策略与 SFT 参考模型的分布偏离施加惩罚,防止「跑偏」。
- 奖励作弊(Reward Hacking):策略找到 RM 的高分漏洞(如冗长、谄媚、固定句式)但真实质量差。
- 策略/参考模型/价值模型/奖励模型:PPO 训练态的四个模型,显存与工程复杂度高。
原理与机制
成对偏好 (y_w 胜, y_l 负) 下,奖励模型用 Bradley-Terry 式目标训练:最大化 σ(r(y_w) − r(y_l)),即「胜者得分应高于负者」。训练策略时,把「生成回答」建模为动作、整段回答的 RM 得分为回报,PPO 更新语言模型;KL 惩罚项把策略「拴」在参考模型附近,兼顾提升与稳定。人类信号的隐含假设:偏好可传递、可被单一标量代理。工程难点集中于 RM 的泛化质量(分布外即失真)与 PPO 超参敏感。
公式或模型
RM 训练与 RLHF 目标(简化形式):
max_π E[ r(x, y) ] − β · KL( π || π_ref )
图示
人类标注: (提示, 回答A ✓优于✗ 回答B) × 数万条
↓ 训练
奖励模型 r(x,y): 给任意回答打分
↓ 强化学习(PPO)
策略(语言模型) 生成 → RM 打分 → 梯度更新
+ KL 惩罚: 不许偏离 SFT 模型太远
直观类比
像培养新厨师的「评委制」:先请美食家(人类)对上百道菜两两比较,训练出一位「口味代理人」(奖励模型);之后厨师做菜不再逐一请教美食家,而是问代理人得分。代理人学得不像,厨师就会琢磨出「多放糖讨好评委」的歪招(奖励作弊)——所以还要规定「不许偏离祖传菜谱太远」(KL 约束)。
实例或案例
Stiennon 等(2020)在摘要任务上用 RLHF 显著提升人类满意度,是方法论奠基;InstructGPT(2022)将其扩展到指令跟随,其评测显示 1.3B 对齐模型的回答被人类偏好于 175B 基座;后续各代对话模型持续沿用(部分改用 DPO 类方法,见 kp-019)。公开讨论的副作用包括输出趋长与「谄媚倾向」(sycophancy),均与奖励信号偏差相关。
常见误区
- 「RLHF 增加知识」:它调整行为分布,不改预训练知识;「更合意」不等于「更正确」。
- 「奖励模型分数 = 真实质量」:RM 是偏好代理,分布外打分不可信,需持续用新鲜人类数据校准。
- 「RLHF 一定优于 SFT」:二者互补——SFT 教格式与行为,偏好阶段调优质感;数据不足时 RLHF 易不稳。
与其他知识点的关系
自测题
- 写出奖励模型的成对偏好训练目标。答案要点:最大化 σ(r(y_win) − r(y_lose)),即负对数似然形式。
- KL 惩罚防止什么问题?代价是什么?答案要点:防止策略为刷分而偏离参考模型过远(过拟合 RM);代价是约束了提升幅度(对齐税的一部分)。
- PPO 训练态需要同时驻留哪几个模型?为什么工程复杂?答案要点:策略、参考、奖励、价值四个模型;显存与流水线调度成本高,超参敏感。
延伸阅读
- Learning to summarize from human feedback(Stiennon 等,2020)
- Proximal Policy Optimization Algorithms(Schulman 等,2017)