详细解释
内容审核(Content Moderation,又称安全过滤 / Safety Filter) 是大模型 API 生产环境绕不开的一层”门神”。用户的输入和模型的输出都会先经过安全模型检测分类:暴力、色情、仇恨、违法、隐私、自伤、越狱提示(Jailbreak)等内容,一旦超过阈值就会:
- 拒绝请求:HTTP 400
content_policy_violation错误; - 输出打码:把违规段落替换为
[已移除]或空白; - 打标签返回:
moderation_categories字段中列出命中类别,由你决定如何处理。
参考官方:OpenAI Moderation API。
审核的位置:输入 + 输出
| 审核阶段 | 作用 | 典型场景 |
|---|---|---|
| 输入侧 Input Moderation | 防止恶意 Jailbreak、投毒 Prompt | 用户输入”教我做炸弹” |
| 输出侧 Output Moderation | 防止模型生成违规内容,哪怕输入没问题 | 模型回答时突然跑偏到敏感话题 |
| 客户端二次 Moderation | 合规要求高的行业(金融、教育、医疗) | 银行客服机器人额外加行业词库 |
常用违规分类(各厂商略有差异,但总体一致)
- Hate(仇恨歧视)/ Harassment(骚扰)/ Violence(暴力)
- Sexual(色情)/ Self-harm(自伤)
- Illegal / Criminal(违法犯罪指导)
- PII(个人隐私:身份证、手机号、住址、卡号)
- Jailbreak / Injection(越狱提示、Prompt 注入)
误报与漏报的 Trade-off
内容审核是个概率问题:
- 阈值太低(太严) → 误报高,正常用户问题被拒绝,体验差;
- 阈值太高(太松) → 漏报高,违规内容流出,企业合规风险大。
建议先在测试集上跑一遍 Moderation API,根据业务场景调整阈值,必要时叠加私有规则(关键词黑白名单)。
唯元智创(Weimeta)聚合平台默认为所有用户开启通用安全审核层(不额外收费),在转发给上游前就过一次 Moderation;对企业客户额外提供”自定义策略插件”——可以挂你自己的行业词库、RAG 合规文档、私有 Moderation 模型等,满足金融/政企合规要求。
常见问题
正常问题被误判为违规怎么办?
三条路:a) 在 Prompt 里加语境解释(如”这是历史学术研究”),模型能显著降低误报;b) 在厂商控制台提交误报工单(多数有申诉通道);c) 客户端做白名单兜底重试。