基于人类反馈的强化学习
RLHF (Reinforcement Learning from Human Feedback)
RLHF(Reinforcement Learning from Human Feedback)是利用人类对模型输出的偏好排序训练奖励模型,再通过强化学习优化大模型的技术,是 ChatGPT 引爆的关键。
详细解释
RLHF(Reinforcement Learning from Human Feedback)是 ChatGPT 引爆全球的「最后一公里」技术。在 ChatGPT 出现之前,GPT-3.5 虽然能力很强,但回答冗长、格式混乱、不安全。OpenAI 团队用 RLHF 把它「驯服」成了一个有用的对话助手。
RLHF 的三阶段流程
阶段 1:监督微调(SFT)
- 收集数万条高质量「问题-回答」对(来自人类标注员)
- 在基模型上做监督微调
- 得到 SFT 模型
阶段 2:训练奖励模型(Reward Model)
- 给 SFT 模型同一个问题的多个回答(K 个)
- 人类标注员对这些回答做偏好排序
- 用 Bradley-Terry 模型训练奖励模型 RM
阶段 3:PPO 强化学习
- 把 SFT 模型当成「策略网络(Policy)」
- 用 RM 对生成的回答打分作为奖励
- 用 PPO(Proximal Policy Optimization)算法更新模型参数
- 同时加 KL 散度约束,防止模型「走偏」
RLHF vs DPO
| 维度 | RLHF | DPO |
|---|---|---|
| 训练阶段 | 3 阶段(SFT → RM → PPO) | 2 阶段(SFT → DPO) |
| 显存需求 | 高(需 4 个模型同时在 GPU) | 低(只需 2 个) |
| 训练稳定性 | 难调,容易发散 | 稳定 |
| 效果 | 略好 | 接近 SFT 基线 +0.5% |
| 代表 | GPT-3.5、Claude、LLaMA-2-Chat | Zephyr、Tulu、Llama-3-Instruct |
实战中的注意点
- 奖励 hacking:模型可能学会「骗」奖励模型,比如堆砌礼貌用语
- KL 散度权重:太大会让模型「学不动」,太小会让模型走偏
- 数据多样性:标注员覆盖不同背景,否则模型只会迎合某一类审美
唯元智创的 RLHF 服务
唯元智创控制台提供 RLHF 训练托管:
- 内置偏好标注工具
- 支持 PPO / DPO / KTO / SimPO 多种算法
- 训练费用 ¥2/千标注样本
- 配套自动评估与红队测试
常见问题
RLHF 需要多少人类标注?
基础效果:1-3 万条偏好对;追求 SOTA:10-30 万条。OpenAI 训练 GPT-3.5 用了约 30 万条人类偏好标注。
能跳过 RLHF 直接做 DPO 吗?
可以。DPO(Direct Preference Optimization)绕过了奖励模型,直接用偏好数据优化策略,训练成本降低 50%+,效果接近 RLHF。