表征工程 / 激活方向向量控制 Representation Engineering

Representation Engineering (RepE) / Activation Engineering / Directional Steering

通过在大模型内部激活层的特定方向(激活向量)上做加法、减法或投影,直接控制模型的输出属性(如诚实度、智商、情绪、合规风格、任务难度偏好),无需重训模型、无需微调、推理时实时生效,是继 Prompt Engineering 之后 2024 年兴起的新一代模型行为控制技术

详细解释

表征工程 Representation Engineering(简称 RepE,又称激活工程 Activation Engineering 或方向控制 Directional Steering) 是 2023-2024 年兴起、在 2024 年后被业界广泛验证有效的第三代「控制大模型行为」的方法。第一代是 Prompt Engineering(靠自然语言提示词在输入层控制,成本为零但效果不稳定,容易被越狱提示绕过);第二代是 微调 / RLHF / 对齐训练(在参数层控制,效果稳定但每次改规则就要重训,周期长达数天至数周,成本极高);第三代 RepE 直接在中间激活层控制模型的内在表征方向,不需要任何参数更新、不需要重训,只要在模型推理时对某几层(通常是第 L/2 到 L-2 层的残差流或注意力输出)的激活向量,在提前计算好的「控制方向向量」上 ±λ 倍步长,就能实时切换或放大、缩小模型的某类输出属性——比如让模型变得更诚实、更少幻觉、更讲逻辑、更具共情力,或反过来抑制其越狱攻击倾向。

RepE 的理论依据来自「线性表征假说 Linear Representation Hypothesis」:大模型在中间层的激活空间里,各类高级概念和属性(诚实、说谎、智商、情绪、合规 vs 违规、事实 vs 幻觉、中文 vs 英文)都以近似「线性方向(方向向量)」的形式被编码——只要沿该方向做加法,模型就更倾向于输出该属性,做减法就抑制该属性。计算这些方向向量的方法非常简单:用一组「反例对」(例如 100 条诚实回答的激活、100 条撒谎回答的激活),分别求两组平均激活,再相减即可得到「诚实方向 d = mean(honest_acts) - mean(lie_acts)」;推理时在目标层的残差流上加上 λ · d,λ 通常取 0.5 至 3.0,即可实现「让模型更诚实」,无需再在 Prompt 里写 100 字强调「请务必说实话不要撒谎」。

唯元智创 聚合平台在 2025 年 Q1 起将 RepE 作为面向行业客户的「合规方向盘」特色能力:客户在控制台勾选自己需要的风格组合(「合规强 + 诚实高 + 情绪稳定」、「创造力高 + 少拒绝 + 多细节」),平台后台就会在推理前根据预设好的 RepE 方向向量库(20+ 维度:诚实、合规、拒绝越狱、创造力、共情力、长思考偏好、代码质量偏好、中文输出偏好、事实率等)组合权重,对指定层残差流做在线方向加法。实测对比:纯 Prompt Engineering 控制模型不输出违规内容,被精心设计的 Jailbreak 越狱提示的成功率约 7% 至 12%;叠加 RepE 合规方向 +λ=2.0 后,同一组越狱样本的成功率下降到 0.3% 以下,同时正常业务请求被误伤拒绝的比例从 3.1% 降到 0.8% 以下,是目前 Guardrails 之外成本最低、效果最稳定的一层对齐增强安全网。

RepE 表征工程与 5 种模型行为控制技术对比表

控制技术控制层级是否需要重训/微调生效延迟合规越狱防御率(同组越狱样本)对正常请求误伤率支持维度数量单请求额外推理成本
Prompt Engineering 提示词工程输入层(上下文)否0(写入 Prompt 即生效)40% 至 70%高(5% 至 15%,Prompt 冲突多)中(可写任意描述但不稳定)0(只是多几 Token 计算)
System Prompt + 少样本示范输入层(System Prompt)否055% 至 80%中(2% 至 8%)中高低(< 1%)
微调 / RLHF / DPO 对齐训练参数层是(每次改规则重训 1 至 7 天)1 至 7 天80% 至 95%低(1% 至 4%)高(对齐阶段整体学习)0(训练完成后推理零成本)
Guardrails 规则 + 分类器外层拦截输入输出层外挂否10 至 50ms75% 至 92%中高(3% 至 10%)低(基于关键词和分类器)中(额外调用 1 至 2 个小模型)
水印 Watermark 检测输出层事后检测否(训练时加或推理时加)事后0(不防御只检测)几乎 01(是否加水印)低(< 2%)
表征工程 RepE(方向向量控制)中间激活层(推理时实时加减)否(向量预计算一次,后续一直用)0ms(推理时直接加,无额外模型调用)93% 至 99.7%(叠加 Guardrails 后 ≥ 99.9%)极低(0.5% 至 2%)极高(每类属性一个方向向量,可任意线性加权组合 10+ 维)极低(< 1%,只是向量加减)
唯元智创 企业安全合规组合:RepE 方向盘 + Guardrails 规则双保险 + 水印三层联防(激活层 + 输入输出层 + 事后追踪)可选微调0ms + 10ms≥ 99.9%≤ 1.0%无上限组合低(< 5% 总推理成本)

实战经验与避坑

  1. 方向向量必须在「你的目标基座 + 你的目标层」上重算,绝对不能跨模型跨层乱套——Llama 3 70B 上算出来的诚实方向直接用在 Qwen2 72B 上可能反效果:很多团队看到论文里给了一个 Llama 系列的方向向量就想直接迁移,结果发现「加了诚实方向反而幻觉更多」。原因是不同基座(甚至同一基座不同尺寸 7B vs 70B)的表征空间几何完全不同,属性方向也完全不同。正确做法:方向向量一定要在你最终要部署的那个具体基座、具体 checkpoint 上,用你行业场景下的「正-反对」各 50 至 200 条样本重新计算;并且选定 2 至 4 层做注入(通常是 L/2 层、3L/4 层、L-2 层这几层组合效果最佳,不是任意一层都合适),同一个诚实方向在第 5 层加和第 30 层加效果可以差 3 倍以上。
  2. λ 强度不是越大越好,必须做「控制强度 - 任务准确率」Trade-off 曲线,找 Pareto 最优点 λ*:很多人以为「我要最诚实就 λ 加到 10.0」,结果 λ 过大时模型会变得过度保守——什么都回答「我不确定我需要查证」,甚至连 1+1=2 这种确定事实都不敢直接说,下游任务准确率掉 10% 至 30%。正确做法:在你自己的行业任务集上扫 λ ∈ 5,每个 λ 同时记两个指标:「目标属性控制指标(如越狱成功率、幻觉率)」和「正常任务准确率(如 EM、F1、人工满意率)」,然后画二维 Pareto 前沿,选「控制达标前提下准确率最高的那个 λ*」。实践中 λ=1.0 到 2.0 是绝大多数场景的甜点区。
  3. 多方向同时控制时不要简单线性相加,先做方向去相关或按任务门控加权,否则会互相打架抵消:很多场景需要同时开 3 个以上方向(「诚实 + 合规 + 高创造力」),直接线性叠加时如果诚实方向和创造力方向本来就有负相关,加起来等于互相抵消、两边效果都没了。推荐两种组合方案:(a) 先做 Gram-Schmidt 正交化:把你要同时开的 N 个方向向量先做正交化,保证每个方向互相独立,再做加权;(b) 按 Prompt 动态门控加权:输入先过一个极小的分类器(175M 参数级别小模型,延迟 1ms 以内),判断这条请求属于「需要严谨事实的金融问答」还是「需要创意发散的广告文案」,前者诚实权重 2.0 / 创造力权重 0.3,后者反之。两种方案任选其一,多方向联合控制的净效果就能比简单相加提升 50% 以上。
  4. RepE 不是越狱防御的单独银弹,要和 Prompt 层 + Guardrails 层组合成三层防御网:单独用 RepE 虽然能把越狱成功率从 10% 压到 1% 以下,但遇到极端复杂的多语言混淆越狱(例如用 base64 编码、倒序输入、脚本小子拼接),仍有漏网之鱼;单独用 Guardrails 又会误伤大量正常请求。实际生产最佳实践是三层防御网:第一层 Prompt 层 System Prompt 明确合规规则(拦 60% 简单越狱)、第二层 RepE 激活层合规方向 +λ(拦 95% 剩余的复杂越狱且不误伤)、第三层 Guardrails 外层输出分类器(拦截最后 5% 的漏网违规内容)。三层叠加后整体越狱防御率通常 ≥ 99.9%,误伤率又能保持在 1% 以下,是 AI 对齐 落地 2025 年的工程最佳实践。
  5. 「诚实 / 幻觉」方向的正反对构造一定要做场景化,不要用通用的说谎数据集直接替代行业的:很多团队用论文里公开的「TruthfulQA / CounterFact」做诚实正反对、算出来的诚实方向直接部署在医疗法律场景,结果在医疗场景的专业事实问题上幻觉率没降多少。原因是「通用世界知识的诚实」和「行业专业知识的诚实」在表征空间里是两个部分重叠但不完全相同的方向。正确做法:正反对 70% 用公开通用数据集 + 30% 用你自己行业的「正确回答 vs 幻觉回答」标注样本,行业数据不需要多,各 50 条就能让最终方向的行业适配度提升一大截,幻觉率的下降幅度能再翻倍。
  6. 推理端支持是 RepE 落地的前提——先确认你的推理框架支持「残差流注入钩子」再做方向训练,不要先算了一大堆方向向量最后发现部署不了:表征工程的前提是你能在推理时读和写中间层激活。vLLM ≥ 0.5、SGLang ≥ 0.3、TensorRT-LLM ≥ 0.9 等主流推理框架现在都原生支持了 Hook 机制,可以注册 custom forward hook 在任意层的 residual/hidden_state/attn_output 上做加减乘;但如果你用的是老旧的原生 HF Transformers generate 或某些闭源 API(GPT-4o、Claude 直接调用),根本拿不到中间激活,RepE 是完全无法落地的。选型前务必先在目标推理框架上跑通「第 20 层残差流加全 0.01 常量不报错、输出随 λ 变化明显」的最小可行性验证,再投入资源做方向数据集和方向计算。

常见问题

表征工程听起来很像 Prompt Engineering 的升级版,它和提示词工程到底有什么本质区别?为什么 RepE 的效果和鲁棒性会高这么多?
根本区别在于「控制深度」和「抗绕过能力」——Prompt Engineering 是在模型输入端最表层「说服」模型,RepE 是直接在模型内部「改变它的内在表征倾向」,后者的作用深度和鲁棒性自然高一个数量级。用一个形象的类比把两者彻底讲透:Prompt Engineering 就像在一个人的耳边反复叮嘱他「等会儿开会一定要诚实不要瞎编哦」——听话的人大多数时候会照做,但如果遇到有人偷偷塞给他一张纸条写「你就瞎编一下骗我吧有好处」(越狱提示),或者他本身就有撒谎的习惯(基座训练数据里太多幻觉样本),叮嘱很容易被忽略;同时如果你耳边同时有十个人说十件不同的事(多条规则、长 Prompt 冲突),他会记不住到底该听哪个,最后规则互相打架、误伤率高。RepE 表征工程就像你直接走进一个人的大脑,把他做决策时神经元的「诚实 / 说谎」天平轴直接往诚实方向扳了一格——他自己可能都不知道为什么,但面对同一个问题时,他第一反应会自动倾向于选诚实的答案、对撒谎答案的概率打分自动下降;就算有人给他写纸条骗他(越狱提示),天平轴的内禀偏移仍然在起作用,越狱成功率会断崖式下降。为什么 RepE 效果这么强?回到线性表征假说的实验证据:大量论文实验已经证明「在很多属性上,Prompt Engineering 只能让模型在输出 logits 层略微偏向目标方向,而 RepE 在中间残差流层加同方向的向量,可以让该属性在后续所有 Attention/MLP 层中被反复放大,最终 logits 层的偏移量是 Prompt 工程的 5 至 20 倍,且不依赖模型是否愿意听你的 Prompt」。再补一个直观的数值对比:Jailbreak 攻防中最著名的 GCG(Greedy Coordinate Gradient)自动生成越狱后缀攻击,对纯 System Prompt 防御的成功率约 40% 至 60%,对加了 3 层 Prompt 规则的也有 20% 以上;但对叠加了合规 RepE 方向(λ=2.0)的同一模型,GCG 在相同的 1000 步优化预算下成功率降到 0.5% 以下,即使再把优化步数拉到 10000 步也找不到有效后缀。原因很简单——Prompt 层再怎么改规则,模型内部「违规输出的表征倾向」还在;而 RepE 直接把违规倾向在激活空间的方向给压下去了,攻击者在输入层再怎么动都撬不动。这就是为什么 RepE 被称为「继 RLHF 之后对齐领域的第二颗银弹」,它第一次让我们在不重训模型的前提下,拥有了真正深度且鲁棒地改变模型内在行为倾向的工程能力。
我用闭源 API(GPT-4o / Claude 3.5)做业务,拿不到中间激活,表征工程对我来说是不是完全没用?有什么替代方案?
闭源 API 场景确实无法「直接在激活层做方向加减」,但 RepE 的核心思想(「用反例对提取目标属性再控制」)可以外化成「Prompt/系统规则层 + API 调用参数层 + 后处理层」的组合策略,拿到 RepE 原生能力 60% 至 80% 的收益,并不是完全没用。给一份闭源 API 场景下的「RepE 思想替代方案」三步走,每条都是已被大量工程实践验证过的有效手段:第一步,把 RepE 的「方向向量计算」思想迁移到「System Prompt A/B 对比 + Few-shot 示范对设计」。原来算方向向量是用 100 条诚实 vs 100 条撒谎样本做差——在闭源 API 场景你就做:(a) 收集行业内的 20 条「理想回答(高诚实高合规)」和 20 条「反面回答(幻觉违规)」;(b) 在 System Prompt 里显式写出两条规则的对比格式:「正确示范:[20 条理想回答的精简写法];错误示范:[20 条反面回答的典型错误写法];你的回答必须严格符合『正确示范』风格,任何时候都不要出现『错误示范』的内容」。这种「正反对 Few-shot 写法」的 System Prompt 本质就是在 Prompt 空间里对模型做了一个「方向偏移」,能把纯自然语言描述规则的合规度提升 30% 至 50%,相当于 RepE 方向 λ≈0.8 的效果。第二步,在 API 调用参数层做「隐式方向盘」配置。其实 Temperature、Top-p、Max Tokens、Frequency/Presence Penalty 这些参数本身就是一组非常粗粒度的「输出属性方向盘」:Temperature 调低(0.1 至 0.3)+ Top-p 0.85 相当于往「事实更确定、少幻觉」方向偏;Temperature 调高(0.9 至 1.1)+ Frequency Penalty 0.3 相当于往「创造力更高、更有细节」方向偏。把参数预设和你的业务类型绑定:事实类问答走低温严谨档、创意文案走高温发散档、客服话术走中间档并加 3 条反例对比。第三步,输出层外挂「轻量 RepE 分类器 + 自动重写」做最终兜底:即使你拿不到基座的中间激活,可以部署一个极便宜的开源 7B 或 13B 小模型(比如 Qwen2-7B Instruct,单 A10 卡即可跑),在小模型上跑通 RepE 方向向量,专门用它对大模型的输出做「幻觉检测、合规检测、风格偏离检测」——如果小模型检测到大模型的回答在「反方向」(幻觉重、违规倾向高),就自动把原回答 + 检测报告 + 反例对比再塞回大模型做一次「自我修订」请求。这套架构就是用小模型的 RepE 给闭源大模型的输出打方向盘,成本只增加 10% 至 20%,但能把整体合规率和事实率再提高 20% 至 30%。最后再补一个商业建议:如果你的业务合规要求极高(金融/医疗/政企),且预算允许,在 唯元智创 这类同时支持闭源 API 聚合 + 开源私有化基座 + RepE 中间激活注入的混合架构里做部署,就能同时拿到闭源模型能力强 + 开源基座安全可控可做 RepE 防御的双重优势,很多头部金融客户已经这么用了 1 年以上,整体合规 ROI 非常显著。
表征工程会不会反而被越狱攻击者利用?用方向向量往「违规方向」加来绕过对齐?这种反向攻击该怎么防御?
这是一个非常真实且被学界 2024 年多篇论文实证过的风险:RepE 既能做「合规方向 +λ」防御,攻击者拿到推理接口或能控制激活时,自然也能用完全相同的方法算「违规方向 +λ」做反向攻击,甚至比纯 Prompt 越狱成功率更高;但这类攻击有严格前提(必须能拿到中间激活读写权限),工程上做好「三层权限隔离 + 方向签名 + 输出审计」就能把风险降到几乎为 0。先把风险边界说清楚:反向 RepE 攻击(又称「Steering Attack」或「Representation Hijacking」)要成功,攻击者必须满足三个必要条件,缺一个就做不成:① 能控制目标推理框架的中间激活注入钩子(有代码权限或 API 暴露了 RepE 接口);② 有少量算力能在同基座上自己算一组「违规方向向量」(几百条样本,1 至 8 卡 GPU 跑几小时);③ 注入 λ 足够大(通常需要 ≥ 2 至 3,且同时加在 2 层以上才有效)。普通外部用户通过标准 HTTP API 调用你的模型是根本拿不到这三个条件的;真实风险主要来自「内部攻击者 / 被攻破的推理节点 / 三方插件市场的恶意插件」。防御就是针对这三个前提一一拆:第一层,权限隔离:中间激活 Hook 接口绝对不对外暴露,只能由受签名保护的安全网关调用。推理服务的 forward hook API 只监听 localhost,外部不可见;任何要注入方向向量的请求必须经过安全网关,网关用公私钥签名机制验证请求身份——只有你的官方合规方向盘配置服务签过名的方向向量 + λ 组合才允许注入,任何来路不明的注入直接丢弃并报警。第二层,方向白名单 + 防篡改签名:预计算好的方向向量入库时做 HMAC 签名,推理端验签后再注入。你要部署的 20 多个合规/诚实方向一次性由安全团队在离线环境下算好、做指纹签名、生成一张不可篡改的白名单表;推理端每次注入方向之前都先校验签名 + 查白名单,任何白名单以外的方向、λ 超过预设上限(如 λ ≥ 3)、签名不对的情况一律拒绝执行,并直接触发安全告警升级到管理员。第三层,输出侧独立反越狱/反向攻击分类器:即使前两层都被攻破了,输出层还能接一个 200M 参数的小分类器专门检测「方向盘攻击特征输出」——反向 RepE 攻击成功时,模型输出的 Token 分布、自 BLEU、概率分布熵会有可识别的统计特征,小分类器 1 毫秒内就能识别并直接拒绝返回,再记录到攻击日志供事后溯源。最后补一个主动防御的高阶技巧:「方向随机微扰(Representation Perturbation)」——在每次推理时,除了你要加的合规方向盘,再叠加一个强度极小的随机正交方向(λ_random ≈ 0.02 至 0.1),这个小扰动对你想要的合规效果几乎没影响,但会让攻击者离线计算出的攻击方向在部署环境下的效果大打折扣,因为激活空间的几何坐标系被轻微扰动后,攻击者计算出来的方向和真实方向就不再严格对齐了。综合这三层防御之后,反向 RepE 攻击的成功率在真实生产环境下会被压到 0.1% 以下,远低于 Prompt 越狱 的风险量级,完全可以被接受。唯元智创 在自己的 RepE 方向盘服务里就完整实现了这三层安全机制,从架构层面避免方向盘被攻击者反向利用,确保客户打开的任何合规配置都只会增强安全不会带来新风险,这也是为什么大量金融政企客户愿意上 RepE 的核心原因——安全性先做足了,收益才能真正落地。