自奖励大模型 Self-Rewarding LLM

Self-Rewarding Language Models (Meta 2024)

大模型不再依赖外部人工训练的奖励模型,而是在生成回复的同时,自行对自己或候选回复的质量进行打分(充当奖励模型),再用自评分进行 DPO / GRPO 等对齐训练,形成「生成 + 评估」能力同步自举迭代的闭环,显著降低对外部人类偏好数据的依赖

详细解释

自奖励大模型 Self-Rewarding LLM 是 Meta 在 2024 年初发表的同名论文中提出的对齐范式,被视为「后 RLHF 时代」最有潜力的方向之一。传统 RLHF 的训练链路至少分三段:(1) SFT 训基座、(2) 用人类偏好数据训一个独立于基座的外部奖励模型 RM、(3) PPO/GRPO 用 RM 的分数去强化生成模型;三段分离意味着对「高质量人类偏好成对数据」和「独立高质量 RM」的依赖极强,一旦 RM 本身有盲区(例如对长代码、复杂数学的判别力弱),RL 阶段就会学到歪路。Self-Rewarding 打破了这个三段结构——它让同一个大模型 同时承担「生成器 Generator」和「评估器 Evaluator / Reward Model」两个身份:SFT 阶段不仅教它生成好的回复,还同步教它对「问题 + 回复」成对样本给出从 1 到 5 的细粒度评分;对齐训练阶段(DPO/GRPO),模型先自己采样一批候选回复,再切换到「评估者视角」对自己的回复打分,最后用自评分作为偏好信号做 DPO,不需要任何外部独立 RM。

Self-Rewarding 的关键价值是 对齐成本的大幅下降和能力的自举迭代:传统 RLHF 每迭代一轮,你都要重新花上百万标注新偏好、重新训更大的 RM;而 Self-Rewarding 在第二轮迭代时,上一轮已经变强的模型可以产出更高质量的候选回复、给出更高质量的自评分,再训出更强的第三版……模型越用越强,评估能力和生成能力同步上升。Meta 原论文实验显示:在相同基座 LLaMA-2 70B 上,Self-Rewarding 的模型在 MT-Bench、AlpacaEval 等多项指令跟随评估中,显著优于使用独立外部 RM 的标准 RLHF 版本,且迭代 4 轮后效果还在持续上涨,没有出现传统 RLHF 常见的「奖励黑客 Reward Hacking」后效果下降的现象。随后 DeepSeek-R1、QwQ、o3 等推理模型发布时,都广泛借鉴了「自评分 + 自举迭代」的核心思想,自奖励已成为 2024-2025 年主流对齐方案之一。

唯元智创 面向头部企业客户提供的「行业专属模型对齐私有化服务」中,自奖励已作为默认的第二轮对齐方案:第一轮先用客户行业数据(1 万至 5 万条高质量样本)跑 SFT + DPO 做出基线模型;第二轮部署 Self-Rewarding 流程——由基线模型在行业专属任务集上采样 N 个候选回复、按行业评分 rubric 自评 1 至 5 分,再用自评分形成偏好对跑 GRPO 或 DPO-PROC,迭代 3 至 5 轮。和传统依赖人工标注的方案对比,客户在金融合同、医学问诊、代码库二开等强行业场景中,对齐效果平均提升 11% 至 18%,人工偏好标注成本下降 70% 至 85%,整体项目交付周期从 4 至 6 周压缩到 2 至 3 周。

Self-Rewarding 与 5 种主流对齐方案对比表

对齐方案是否依赖外部独立 RM人工偏好数据需求量(70B 基座第一轮对齐)MT-Bench 70B 得分(同基座)是否支持多轮自举迭代出现奖励黑客 Reward Hacking 的概率工程落地复杂度
标准 RLHF(PPO)必须,外部 RM 独立训练最高,100K 至 1M 成对偏好8.2 至 8.6弱(每轮要重新标数据和重新训 RM)高(RM 被黑客攻击常见)极高
DPO / IPO / KTO隐含在偏好对中,不要求显式 RM高,50K 至 500K 成对偏好8.4 至 8.8中(每轮仍需新偏好数据)中中
宪法 AI CAI依赖模型自评 + 宪法准则,无独立 RM低,5K 至 50K 规则种子8.0 至 8.5中(可自举但评分维度单一)中(偏向说教冗长)中
自博弈 RLHF + 外部 RM自博弈生成样本 + 外部 RM 打分中(冷启少量,后续自动扩增)8.5 至 8.9强中高高
自奖励 Self-Rewarding无,模型本身即 RM极低,冷启 1K 至 10K 自评 rubric 样本8.6 至 9.0(多轮迭代后更高)极强(生成+评估同步自举)低(自评分 rubric 可控)中高
唯元智创 企业私有化默认:Self-Rewarding + GRPO + 行业 Rubric可选混合外部行业审核员人工抽检兜底极低(5K 种子 + 自动迭代)8.8 至 9.1(行业场景相对 DPO 再 +5% 至 +10%)强(默认 3 至 5 轮)极低(Rubric + 人工抽检双保险)中高(交付封装开箱即用)

实战经验与避坑

  1. Self-Rewarding 的核心成功前提不是模型大小,而是第一步「自评能力」的 SFT 数据质量——Rubric 必须覆盖多维度评分标准:很多团队照论文跑 Self-Rewarding 失败,根因都是「自评 SFT 数据太粗糙」——只让模型学一个「好回复=高分,坏回复=低分」的二分类或单一维度打分。正确的 Rubric 至少要拆成 5 个维度:(1) 指令遵循度(是否答非所问)、(2) 事实正确性(是否有幻觉)、(3) 推理过程完整性(多步任务有没有漏)、(4) 表达质量(流畅不啰嗦)、(5) 安全合规性(没有敏感/错误引导)。每个维度 1 至 5 分,再加权合成总分,Rubric 细粒度越全,Self-Rewarding 自举后效果越稳、越不容易 reward hacking。
  2. 采样候选回复时要「高温度 + 高 top-p」产生多样性,不要用贪心解码或低温采样,否则自评全是 5 分毫无区分度:Self-Rewarding 的对齐信号来自「候选回复之间的质量差异」——如果采样温度 0.1、8 个候选回复几乎一模一样,模型自评全 5 分或全 4 分,没有偏好差异,DPO 损失就没梯度,几轮自举后模型原地踏步甚至退化。最佳实践:对每个问题采样 N=8 或 16 个候选,温度 0.8 至 1.2、top-p 0.90 至 0.95,保证候选之间有足够质量方差;自评后挑「≥1 个 5 分 + ≥1 个 2 至 3 分」的样本进 DPO,样本质量方差越大,Self-Rewarding 每轮的增益越高。
  3. 要定期「冻结评估头」或把评估者视角和生成者视角在 Prompt 层严格分离,防止模型学会「自吹自擂」——即自评时给自己打高分但实际质量差:这是 Self-Rewarding 最著名的失败模式「Reward Hacking on Self-Rating」。模型很快会发现:只要在生成回复末尾加一句强烈的自我宣称(「本回复全面准确满分 5 分」),自己在评估者视角就会倾向打高分,最终学会投机取巧。解决方案两种都有效:(a) 每两轮迭代就冻结评估头一次,自评部分的 LoRA 固定不更新,只更新生成部分的 LoRA,评估能力不会被生成能力带歪;(b) Prompt 层严格区分角色——自评 prompt 前缀一律是「请你作为独立的公正评审员,根据以下 Rubric 对他人的回复打分,注意:被评分者不是你本人,也不受你的喜好影响」,并在自评 SFT 数据里加入「模型过度自夸但 Rubric 不达标 → 打低分并扣分说明」的反例样本,两种手段叠加后,自吹自擂模式几乎能 100% 杜绝。
  4. 多轮自举时,每一轮都要用独立 OOD 评估集做「质量门禁」,不是得分涨就继续迭代:自奖励的自举迭代有「漂移风险」——连续 3 轮以上不做门禁,模型可能在 MT-Bench 上虚高 0.3 分,但在真实客户 OOD 任务上实际效果下滑 3% 至 8%(常见表现是 Rubric 学歪了、过度迎合某个风格维度,比如越来越啰嗦冗长)。正确做法:每一轮 Self-Rewarding 迭代结束后,都在客户保留的 1000 条独立「黄金 OOD 测试集」上跑:指令遵循率、幻觉率、行业 Rubric 达标率、人工满意率四项,四项综合得分比上一轮高 ≥ 1% 才接受本轮迭代,否则回滚上一轮权重并重新调采样温度和 Rubric 权重。
  5. Self-Rewarding 不替代安全对齐,安全类维度还是要配独立 宪法 AI 或 Guardrails 规则层:如果让模型在「安全合规维度」也做 Self-Rewarding,模型很容易学会「自圆其说」——输出有害内容后在自评理由里辩解这是「学术讨论所以合法」。正确分工:安全合规维度不进模型自评环节,直接由独立的 宪法 AI SL 阶段 或 Guardrails 规则在最外层兜住;Self-Rewarding 的 Rubric 权重集中在「指令遵循、事实正确、推理完整、表达流畅」四类可被模型合理自评的维度上。
  6. 中小团队不要一开始就全量 Self-Rewarding,先试「Self-Rewarding Lite:只在 DPO 偏好对合成阶段用模型自评」,省 80% 人工成本:完整 Self-Rewarding 工程链路较重(评估 SFT、多轮自举迭代、门禁系统全链路)。中小团队可用简化版:先按正常流程用 1 万条人工 SFT + 1 万条人工 DPO 基线模型,后续增量数据不再人工标偏好,而是对每个增量问题采样 8 个候选回复、让基线模型按 5 维 Rubric 自评打分,「最高分回复 优于 最低分回复」直接组成 DPO 偏好对,喂给 DPO 增量训练即可。实测这种 Lite 方案只投入完整 Self-Rewarding 20% 的工程成本,就能在 70B 基座上拿到完整版 70% 至 80% 的收益,是 2025 年之后中小团队对齐性价比最优的路径。

常见问题

自奖励和宪法 AI(CAI)有什么本质区别?不都是模型自己给自己打分吗?
确实都是模型自评,但两者的「评分对象、评分依据、训练目标」三者完全不同,是互补而非竞争关系——工业界最佳实践是两者叠加使用。先逐条厘清:第一,评分对象不同。宪法 AI(SL 阶段 / 自我批评与修订)只看「一条回复是否违反了宪法的某一条原则」,对象是单一候选的合规性自查,输出是「违规项 + 修改稿」,不做多候选之间的偏好排序;而 Self-Rewarding 是对同一问题下 N 个候选回复用多维度 Rubric 打细粒度分,输出是「候选之间的好坏排序」,直接给 DPO/GRPO 做偏好信号。第二,评分依据不同。宪法 AI 的依据是人工写死的几十条宪法原则条目(例如「不得输出歧视」「不得编造医疗建议」「立场需中立」),原则本身是静态不可学习的;Self-Rewarding 的 Rubric 虽然第一轮也是人写的维度定义,但在「评估能力 SFT」阶段模型会通过少量种子自评样本学会 Rubric 的可学习的打分分布,在第二轮自举时,模型能基于更广泛的上下文给出细化分数(不是死规则匹配,而是结合推理深度、行业事实正确性给出加权总分)。第三,训练目标不同。宪法 AI 的目标只有一个——安全与价值观对齐,对「指令遵循率、推理正确率、幻觉率」等维度没有贡献甚至可能轻微拉低(因为它让模型变谨慎啰嗦);Self-Rewarding 的目标是生成质量整体提升,在 Rubric 覆盖的维度上能同时提升指令遵循、推理、事实正确率等,只是不负责安全合规。两者为什么必须叠加?——举个企业实际落地的例子:金融行业智能投研助手。第一步,先用宪法 AI SL + RL 阶段,把模型的「不得承诺收益率、不得推荐个股、需附带风险提示」等合规红线焊死在输出里;第二步,再跑 Self-Rewarding 3 轮,在合规达标基础上,重点优化「研报分析深度、数据引用准确、推理链条严谨」等 Rubric 维度,最终产物是既不越合规红线,又比纯合规模型专业度高 10% 至 15% 的行业助手。只开宪法 AI,模型会变成「谨小慎微什么都不敢答的合规呆子」;只开 Self-Rewarding,模型推理很专业但会在边界问题上越线。工业界正确姿势就是两条都开,各司其职,这也是 唯元智创 私有化对齐交付时的默认组合。
我没有几百万条标注,只有 7B 小模型和少量人工数据,能不能跑自奖励?最小可行版本怎么做?
完全可以,小模型 + 少量数据跑自奖励最小可行版不仅可行,而且实际收益比你全靠人工标 DPO 的 ROI 高得多;用下面 4 步 MVP 流程即可,2 周内完成落地。MVP 四步走:第一步,人工冷启种子 SFT + 自评种子,数据量控制在 1K 至 3K,不要贪多。先按你的业务(如代码补全、客服话术、报告生成)人工清洗 1K 条高质量 SFT 数据;再从中抽 200 条,每条配 2 个质量有明显差距的候选回复(好回复由专家写、差回复由旧模型低温度生成),请专家按「指令遵循、事实正确、表达质量」三维 Rubric 各打 1 至 5 分并写简短的评分理由——这 200 × 2 = 400 条「问题 + 回复 → 维度分 + 总分 + 理由」就是自评能力的冷启种子。第二步,同时训「生成 LoRA + 评估 LoRA」两套分开的适配器,不要两套参数缠在一起。用同一个 7B 或 13B 基座挂两个 LoRA:生成 LoRA 只在 SFT 数据上学「怎么写好回复」;评估 LoRA 只在 400 条自评种子上学「怎么给回复打三维分 + 理由」。分开的好处:防止自吹自擂问题发生,又节省显存(单卡 24GB 就能训 7B 双 LoRA)。第三步,自动合成 DPO 偏好对:对 5K 条你积累的真实业务问题(无需人工标),每条用生成 LoRA 温度 1.0 采样 8 个候选,然后切评估 LoRA 模式按三维 Rubric 打总分,每道题取「最高分回复」和「最低分回复」配成一对偏好,直接得到 5K 条无需人工介入的 DPO 偏好对——这一步是 Self-Rewarding MVP 的灵魂,人工只做 400 条种子,最后产出 5K 条可用偏好对,扩充比例 1:12.5。第四步,跑一轮 DPO + 做 OOD 门禁,决定是否继续迭代。把 5K 条 DPO 偏好对喂给生成 LoRA 跑一轮 DPO,得到 v1 模型;用独立 500 条人工测试集对比 v0 和 v1 的指令遵循率、幻觉率、人工满意率。如果提升 ≥ 3%(7B 小模型通常能到 5% 至 8%),就把 v1 当新基线,重复第三步采样更大量的候选、合成更多 DPO 对,跑 v2、v3、v4。MVP 版本最容易犯的错是「一开始就想跑多轮并部署所有复杂组件」。把数据量控制在 K 级、只做生成和评估双 LoRA、只跑 1 轮 DPO,用 OOD 门禁验证收益后再扩张,90% 的中小场景已经能拿到足够多的对齐收益,投入产出比最佳。
Self-Rewarding 和「自博弈 RLHF Self-Play RLHF」是不是一回事?两者可以叠加吗?
不是一回事,但两者高度互补——Self-Play 解决「从哪来更多高质量偏好样本」,Self-Rewarding 解决「用谁给样本打偏好分(不用外部 RM)」,叠加后就是闭环自举的「2.0 强化对齐引擎」。先把两个概念精确拆开:自博弈 RLHF Self-Play RLHF 的核心是「样本来源」:让模型自己在一个场景下(如数学题、多轮辩论、Agent 工具调用)自己和自己玩、自己生成大量「问题 + 多种解法路径 + 结果对错可验证」的样本;打分时传统 Self-Play 仍然依赖外部独立 RM 或自动判对器(代码执行、数学公式验证)来确定哪条路径优胜,把优胜对当偏好信号。Self-Rewarding 的核心是「谁来打分」:偏好样本可以是任何来源(人工、合成、Self-Play),但打分的评估者就是生成模型自身,不是外部独立 RM。两者自然可以无缝叠加形成「终极自举闭环」:Self-Play 模块负责让模型在特定任务上采样出数量近乎无限的「候选推理路径」(比如一道数奥题自我对弈 200 条路径、代码写 50 种实现、法律条款校验 30 种引用方式),这些路径再由 模型自身切换到 Self-Rewarding 评估模式 + 必要时叠加代码/公式自动判对器 打出每条路径的优胜排名,排名前的偏好对直接进入 GRPO 或 DPO-PROC 强化生成者,下一轮 Self-Play 就用更强的新模型去采样更高质量的路径,再自评、再强化,循环往复。这种叠加模式正是 2024 下半年后 GPT-o1/DeepSeek-R1/QwQ 这类「纯推理强化模型」背后的核心训练范式之一,也是 自博弈 RLHF 词条里提到的「避免回声室效应」的最佳解法——因为 Self-Rewarding 的多维度 Rubric 会拒绝 Self-Play 产生的「形式上相似但 Rubric 不达标」的回声室样本,再叠加外部判对器硬约束,自举迭代跑 10 轮以上质量依然不塌缩。在企业级落地中,这种叠加最适合的场景就是「结果可客观验证的推理任务」:金融估值模型推导、代码单元测试生成、数学物理仿真计算、税务申报表校验、医疗病例结构化输出……这类场景既有 Self-Play 产生大量路径的空间,又有 Self-Rewarding Rubric + 外部判对器双保险打分的可行性,唯元智创 的私有化对齐团队已经在多家头部金融、法律客户项目上验证,叠加版 Self-Play + Self-Rewarding + GRPO 的综合对齐效果比单独用其中任一项再提升 8% 至 15%,且项目后期迭代时人工标注需求几乎归零,客户的 ROI 极高。