后训练与对齐 进阶 约 25 分钟 更新 2026-10-02

RLHF 与奖励建模

学习状态:
未学

一句话定义

RLHF(Reinforcement Learning from Human Feedback)先用人类偏好数据训练一个奖励模型来「替人打分」,再用强化学习(通常是 PPO)优化语言模型策略使其输出获得更高奖励,同时被约束不偏离初始模型过远。

为什么重要

RLHF 是 ChatGPT 时代的关键技术标签,把「人类觉得好」首次变成可优化的标量信号。理解它,才能理解 DPO 等后续方法在优化什么、简化了什么;也才能识别奖励作弊、对齐税等真实工程问题的根源。

前置知识

核心概念

原理与机制

成对偏好 (y_w 胜, y_l 负) 下,奖励模型用 Bradley-Terry 式目标训练:最大化 σ(r(y_w) − r(y_l)),即「胜者得分应高于负者」。训练策略时,把「生成回答」建模为动作、整段回答的 RM 得分为回报,PPO 更新语言模型;KL 惩罚项把策略「拴」在参考模型附近,兼顾提升与稳定。人类信号的隐含假设:偏好可传递、可被单一标量代理。工程难点集中于 RM 的泛化质量(分布外即失真)与 PPO 超参敏感。

公式或模型

RM 训练与 RLHF 目标(简化形式):

L_RM = − log σ( r(x, y_win) − r(x, y_lose) )
max_π E[ r(x, y) ] − β · KL( π || π_ref )

图示

人类标注: (提示, 回答A ✓优于✗ 回答B) × 数万条
   ↓ 训练
奖励模型 r(x,y): 给任意回答打分
   ↓ 强化学习(PPO)
策略(语言模型) 生成 → RM 打分 → 梯度更新
   + KL 惩罚: 不许偏离 SFT 模型太远

直观类比

像培养新厨师的「评委制」:先请美食家(人类)对上百道菜两两比较,训练出一位「口味代理人」(奖励模型);之后厨师做菜不再逐一请教美食家,而是问代理人得分。代理人学得不像,厨师就会琢磨出「多放糖讨好评委」的歪招(奖励作弊)——所以还要规定「不许偏离祖传菜谱太远」(KL 约束)。

实例或案例

Stiennon 等(2020)在摘要任务上用 RLHF 显著提升人类满意度,是方法论奠基;InstructGPT(2022)将其扩展到指令跟随,其评测显示 1.3B 对齐模型的回答被人类偏好于 175B 基座;后续各代对话模型持续沿用(部分改用 DPO 类方法,见 kp-019)。公开讨论的副作用包括输出趋长与「谄媚倾向」(sycophancy),均与奖励信号偏差相关。

常见误区

与其他知识点的关系

自测题

  1. 写出奖励模型的成对偏好训练目标。
    答案要点:最大化 σ(r(y_win) − r(y_lose)),即负对数似然形式。
  2. KL 惩罚防止什么问题?代价是什么?
    答案要点:防止策略为刷分而偏离参考模型过远(过拟合 RM);代价是约束了提升幅度(对齐税的一部分)。
  3. PPO 训练态需要同时驻留哪几个模型?为什么工程复杂?
    答案要点:策略、参考、奖励、价值四个模型;显存与流水线调度成本高,超参敏感。

延伸阅读