内容审核(安全过滤)

Content Moderation / Safety Filter

内容审核(安全过滤)是 API 服务端或客户端对输入 Prompt 和输出文本进行自动合规审查的机制,命中违规分类会拒绝请求或打安全标签,是大模型上线的必选项。

详细解释

内容审核(Content Moderation,又称安全过滤 / Safety Filter) 是大模型 API 生产环境绕不开的一层”门神”。用户的输入和模型的输出都会先经过安全模型检测分类:暴力、色情、仇恨、违法、隐私、自伤、越狱提示(Jailbreak)等内容,一旦超过阈值就会:

  • 拒绝请求:HTTP 400 content_policy_violation 错误;
  • 输出打码:把违规段落替换为 [已移除] 或空白;
  • 打标签返回moderation_categories 字段中列出命中类别,由你决定如何处理。

参考官方:OpenAI Moderation API

审核的位置:输入 + 输出

审核阶段作用典型场景
输入侧 Input Moderation防止恶意 Jailbreak、投毒 Prompt用户输入”教我做炸弹”
输出侧 Output Moderation防止模型生成违规内容,哪怕输入没问题模型回答时突然跑偏到敏感话题
客户端二次 Moderation合规要求高的行业(金融、教育、医疗)银行客服机器人额外加行业词库

常用违规分类(各厂商略有差异,但总体一致)

  • Hate(仇恨歧视)/ Harassment(骚扰)/ Violence(暴力)
  • Sexual(色情)/ Self-harm(自伤)
  • Illegal / Criminal(违法犯罪指导)
  • PII(个人隐私:身份证、手机号、住址、卡号)
  • Jailbreak / Injection(越狱提示、Prompt 注入)

误报与漏报的 Trade-off

内容审核是个概率问题:

  • 阈值太低(太严) → 误报高,正常用户问题被拒绝,体验差;
  • 阈值太高(太松) → 漏报高,违规内容流出,企业合规风险大。

建议先在测试集上跑一遍 Moderation API,根据业务场景调整阈值,必要时叠加私有规则(关键词黑白名单)。

唯元智创(Weimeta)聚合平台默认为所有用户开启通用安全审核层(不额外收费),在转发给上游前就过一次 Moderation;对企业客户额外提供”自定义策略插件”——可以挂你自己的行业词库、RAG 合规文档、私有 Moderation 模型等,满足金融/政企合规要求。

常见问题

正常问题被误判为违规怎么办?
三条路:a) 在 Prompt 里加语境解释(如”这是历史学术研究”),模型能显著降低误报;b) 在厂商控制台提交误报工单(多数有申诉通道);c) 客户端做白名单兜底重试。