详细解释
自博弈 RLHF(Self-Play Reinforcement Learning from Human Feedback)是把传统 RLHF 中「人类标注偏好数据」这一昂贵瓶颈,用「模型自我对弈 + 奖励模型打分 + 少量人工审计」的组合替代的训练范式。它的核心思路源自 AlphaGo 的自博弈思想:让同一模型(或互为镜像的两个模型)在同一问题上扮演「提问者、回答者、裁判者」三重角色,自动产出大量成对的偏好数据(Chosen vs Rejected),再喂给 RLHF 后续的奖励建模与 PPO/DPO 步骤。
典型的自博弈 RLHF 流水线包含五阶段:(1) 种子指令集或场景脚本构建,覆盖 10 至 20 类目标任务;(2) 让 Actor 模型以多温度采样(T=0.3/0.7/1.2)对每条指令输出 4 至 8 条不同回答;(3) 用 3 种裁判来源对候选回答做两两排序:奖励模型打分、Self-Critique 自我批评、一致性校验(与外部工具/检索结果对照);(4) 对排序后的成对偏好做置信度分级,高置信度直接入训练集,低置信度抽样送人工 1% 至 3% 复核;(5) 用 DPO 或 KTO 做无 Critic 的偏好对齐,或保留经典 PPO 流程。
唯元智创 的对齐平台默认支持自博弈偏好数据流水线,可在接入原始模型后的 24 小时内自动产出 50 万条高置信度偏好对,相比纯人工标注的成本下降 80% 至 90%;同时内置「人工复核触发阈值」:某任务类别低置信度占比超过 15% 即自动暂停并发起人工标注任务,避免错误偏好的滚雪球放大。也可对比 RLHF 的经典人工标注流程。
自博弈 RLHF 与经典 RLHF 对比表
| 维度 | 经典 RLHF(人工标注) | 自博弈 RLHF(自动) | 混合 RLHF(10% 人工 + 90% 自博弈) |
|---|---|---|---|
| 标注成本 | 100 基准 | 降低 80% 至 90% | 降低 70% 至 80% |
| 单周可产出偏好对规模 | 1 万至 5 万 | 50 万至 500 万 | 40 万至 200 万 |
| 复杂推理任务保留度 | 95% 至 98% | 85% 至 90% | 92% 至 95% |
| 安全偏好漂移风险 | 极低(人工直接控) | 中(需审计 1% 至 3%) | 极低至低 |
| 迭代周期 | 2 至 4 周 | 3 至 7 天 | 5 至 10 天 |
| 适合场景 | 高风险金融/医疗/合规 | 通用对话、低风险客服 | 大多数企业级落地(推荐) |
| 推荐度 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
实战经验与避坑
- 自博弈生成的候选回答必须覆盖「好、中、差」三档:仅用同一温度采样会导致候选回答质量接近,奖励模型学到的偏好信号很弱;推荐温度从 T=0.2(保守)一直扫到 T=1.5(发散),且固定 seed 保证可复现,再让 奖励模型 和裁判规则对每对候选做明确区分。
- 偏好对构建务必做「难例挖掘」:不要拿「明显正确 vs 明显胡编」的简单对凑数,这类样本训练 1 轮就饱和;应当筛选「奖励分差距 0.15 至 0.4 的边界样本」占比达到 60% 以上,这类难例能显著提升对齐后的泛化能力。
- 设置「裁判一致性阈值」避免自博弈滚雪球:三种裁判(RM / Self-Critique / 工具校验)对同一偏好对的投票不一致率若超过 30%,必须剔除该样本或送入人工复核;若某任务类别连续 3 轮不一致率偏高,应当暂停自博弈并扩充该类的种子脚本与人工金标。
- 自博弈产出的偏好数据务必做「去重与聚类」:由于采样的随机性,自博弈会产出大量语义高度重复的偏好对,直接训练会让模型在高频模式上过拟合;推荐用 Embedding 余弦相似度 0.9 以上做去重,再按 15 至 20 个任务类别做分层抽样,确保每类最低占比 5%。
- 每轮自博弈 RLHF 后必须做「对齐税与安全审计」双指标:对齐税(常规指令的 IFE 指令遵循率下降)必须控制在 2% 以内,安全拒答率下降必须控制在 1.5% 以内;两项任一超标就需要削减本轮自博弈数据的比例(从 100% 切回 70% 自博弈 + 30% 人工金标)并重新训练。
- 不要在 SFT 之前直接跳自博弈 RLHF:未经 SFT 的底座模型输出发散、缺乏指令遵循格式,自博弈产出的候选回答几乎不可用;正确顺序是「底座 SFT → 安全对齐 SFT(少量人工金标)→ 第一轮自博弈偏好构建 → DPO 对齐 → 重复自博弈 + DPO 2 至 3 轮」,每轮自博弈引入的「新能力」都会明显收敛。