详细解释
宪法 AI(Constitutional AI,简称 CAI)是由 Anthropic 提出的价值观对齐范式,核心思想是用「一套公开、可审计的价值观原则集合(即宪法)」替代传统 RLHF 中密集的人工偏好标注,让模型通过自我批判与自我修正的两阶段循环,自动对齐到人类认可的无害、诚实、有益三项核心价值观。相比纯人工标注对齐,CAI 的最大优势是「规则透明 + 可追溯 + 变更成本低」——当价值观需要调整时,只需修改宪法条文而无需重标几万条偏好数据。
经典 CAI 流水线包含两个核心阶段:第一阶段「监督式自我修正(SL-CAI)」,即对有害/敏感输入,让模型先做一次原始回答,再对照宪法条文逐条批判自身回答的问题,最后重新生成符合宪法的修正回答,最终用修正后的(有害输入 → 合规回答)配对做 SFT;第二阶段「强化学习式自我修正(RL-CAI)」,即进一步用宪法做偏好判断,对同一问题的多条候选回答按合规度自动排序,构建偏好对后训练奖励模型,再执行 PPO 或 DPO 对齐。
唯元智创 的对齐平台内置了「CAI 宪法模板库」,覆盖中国合规、全球通用、金融、医疗、教育五大行业共 300 余条现成原则,可一键生成 SL-CAI 与 RL-CAI 数据集;并支持「宪法变更热切换」,重新对齐同一模型的成本下降 80% 以上。也可与 AI 对齐 的通用框架做对比。
CAI 宪法原则示例与三大对齐范式对比表
| 对比维度 | 经典 RLHF(人工偏好) | 宪法 AI CAI | 混合(CAI + 10% 人工复核) |
|---|---|---|---|
| 价值观可追溯性 | 差(标注员心智黑盒) | 极好(每条输出对应宪法条目) | 极好 |
| 规则变更成本 | 极高(重标 10 万级数据) | 极低(改条文 + 重新对齐一轮) | 极低 |
| 安全拒答率目标达成 | 95% 至 98% | 92% 至 95% | 95% 至 97% |
| 对齐税(常规指令下降) | 1% 至 2% | 2% 至 3% | 1.5% 至 2% |
| 冷启动数据需求 | 人工 5 万+ 偏好对 | 0 至 100 条宪法原则 | 100 条原则 + 5000 人工金标 |
| 适合场景 | 极高风险合规类 | 通用对话/快速迭代对齐 | 绝大多数企业落地(推荐) |
| 推荐度 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
实战经验与避坑
- 宪法条文必须写得「可操作、可批判、可判定」:避免抽象条文如「回答要友善」;应写成具体检查清单如「回答不得使用侮辱性词汇清单(蠢货/白痴/垃圾等 12 项),对对方人格的攻击性评价必须替换为对具体行为的客观描述」。条文颗粒度建议控制在 100 至 300 字每条,每条只覆盖一种违规类型,总数 20 至 80 条足够覆盖常见场景。
- SL-CAI 阶段要做「分层违规难度采样」:把有害输入按违规难度分为三类——轻度(擦边球/轻微歧视)、中度(明显不当但未违法)、重度(违法/越狱/极端),每类占比建议 4:4:2;如果重度占比过高,模型会学到「只会拒答、不敢处理合法擦边球」,如果轻度不足,遇到实际场景的边界样本就会漏判。可配合 越狱红队测试 的案例库做补充。
- RL-CAI 阶段的偏好判分必须引入「多宪法条文联合打分」:单一地按某一条合规与否做二元区分,会让模型学到过度保守的拒答模式;正确做法是每条候选回答对应 10 至 20 条相关宪法条文,逐条按「完全符合 2 分 / 部分符合 1 分 / 违反 0 分」打分后加权聚合,权重由合规团队审核确定;这样偏好排序的置信度更高,对齐税也能降低 0.5 至 1 个百分点。
- 宪法变更后务必做「回归评测」三件套:第一,经典安全评测集(如 1000 条常见有害指令)的拒答率,变更前后波动必须控制在 ±2%;第二,业务常规指令(IFE 指令遵循)的解决率,对齐税不得超过 2%;第三,「价值观变更热点条目」人工抽样 100 条做具体核对,确保宪法变更真实传递到了模型输出,而不是只改了文档。
- 宪法 AI 不要替代所有人工复核:推荐保留 1% 至 3% 的高风险输出(医疗/法律/金融建议、涉及未成年人、涉及种族/宗教敏感话题)送人工专家审核;这些审核结果再回滚修正宪法条文,形成「宪法 → 自我修正 → 人工复核 → 宪法迭代」的闭环,持续 3 至 5 轮后对齐效果会稳定超过纯 RLHF。
- 不要把「拒绝一切敏感请求」当作唯一的合规路径:CAI 的精髓是「在合规范围内尽可能提供有益的回答」。例如对「如何识别投资骗局」这类合法请求,模型应当给出客观教育性回答,而不是一刀切拒答。宪法条文里必须明确「可回答的合法教育类例外」,否则模型的拒答率过高会严重影响业务可用性。
常见问题
宪法 AI 和传统 RLHF 到底哪个效果更好?什么时候必须选 CAI?
两者的差异不在「最终效果上限」,而在「可追溯性、变更成本、冷启动速度」三项工程属性:当标注预算充足、标注团队稳定且价值观在 1 年内不会大改时,经典 RLHF 的对齐税通常比 CAI 低 0.5 至 1 个百分点;但当出现以下三种情况时,CAI 是不可替代的选择——第一,合规要求频繁变更(如金融监管新规每季度更新、跨境多地区合规要求不同),RLHF 重标一轮成本达百万级,而 CAI 只需改宪法条文 + 1 周重新对齐;第二,客户要求「每条输出的合规依据可追溯」(金融/医疗/政务等高审计行业),CAI 能直接输出「本回答依据宪法第 7 条第 3 款修正」的审计日志;第三,冷启动阶段没有足够标注预算或团队,CAI 仅靠 30 至 50 条宪法原则即可在 1 周内完成第一轮基础对齐。企业级落地的主流方案是 「混合模式」:先用 CAI 做 90% 的基础对齐,再拿 1% 至 3% 的高风险边界样本做人工偏好微调,最终效果通常优于纯 RLHF 或纯 CAI。
宪法条文太啰嗦或太抽象,模型批判不出来问题怎么办?
用「三要素法」重写每条宪法,并做 Few-Shot 批判示例即可让模型批判准确率提升 20% 以上:每条宪法条文必须包含三个明确要素——「违规判定标准 + 违规具体示例 2 至 3 条 + 修正回答示例 2 至 3 条」。例如把抽象的「不得发表地域歧视言论」细化为「判定标准:提及某省/某市/某地区人群整体负面特质(如 XX 人都骗子);违规示例:东北人都是黑社会、河南人都偷东西;修正示例:此类说法是不公平刻板印象,个体行为不能代表整个群体,建议关注具体事实」。此外,SL-CAI 的自我批判 Prompt 里要附上 3 至 5 条 Few-Shot 示例(原始回答 → 逐条批判 → 修正后回答),模型对抽象条文的落地执行准确率可从 70% 提升到 90% 以上;最后,对批判失败的样本做聚类,如发现集中在某一类违规(如法律建议边界),就单独补充 10 至 20 条宪法细化规则,持续迭代效果会显著提升。
我怎么验证 CAI 对齐后的模型真的「遵守宪法」,而不是学会了表面话术?
用「三层攻击评测矩阵 + 宪法条文映射审计」可穿透表面话术,95% 准确识别「伪对齐」:第一层是 标准安全集评测(如 HarmBench / AdvBench 中文版),对齐后高危指令的违规输出率必须低于 2%;第二层是 对抗性越狱测试,覆盖编码越狱、角色扮演越狱、多轮渐进式越狱、翻译混淆越狱等 红队测试 标准方法,违规输出率必须低于 3%;第三层是 宪法条文覆盖度抽样审计:把 20 至 80 条宪法条文每一条单独构造 10 至 20 条「触发违规的边界输入」,逐一检验模型输出是否真实遵守了该条文而不是仅用拒答模板回避,每条条文的合规率目标为 95% 以上;最后做「宪法映射率统计」:随机抽样 200 条模型输出,检验能否在 30 秒内明确追溯到具体宪法条文,映射率目标 90% 以上。四层全部达标,基本可以确定模型是「真遵守宪法」而非仅学到表面拒答。