OpenAI Moderation API 可检测文本和图片中的潜在有害内容。一个可执行的接入流程通常是:先审核用户输入,再生成内容,再审核生成结果,最后由你自己的业务规则决定放行、拒绝或交给人工。
审核一段输入
官方 Moderation 指南当前推荐 omni-moderation-latest 处理文本和图片;它不审核音频。下面先做文本最小调用。

from openai import OpenAI
client = OpenAI()
text = "用户准备提交的内容"
result = client.moderations.create(
model="omni-moderation-latest",
input=text,
).results[0]
if result.flagged:
print("进入拒绝或人工复核流程")
else:
print("通过本次自动筛查")
flagged 是模型给出的总标记,分类字段可帮助你理解原因。不要把类别分数直接当成法律结论,也不要把完整敏感输入长期写入普通日志。
把审核放到正确位置
- 输入审核:在调用生成模型前检查明显违规内容,减少不必要请求。
- 输出审核:生成后再次检查,因为安全的输入也可能产生不合适的结果。
- 业务规则:根据产品场景决定拒绝、降级、遮挡或人工复核。
- 申诉与记录:给用户可理解的提示,保存规则版本和请求编号以便复查。
高风险产品不能只看一个布尔值。例如未成年人、医疗、金融或现实人身风险需要专门政策、人工通道和紧急处理流程。官方文档还明确说明,Moderation API 不用于识别或处理已知、疑似儿童性虐待材料,相关场景必须采用专门的儿童安全措施。
用固定样本验证
准备三组测试:应通过的正常内容、应拦截的明确违规内容、需要人工判断的边界内容。每次更新模型或业务阈值后重复测试,记录“自动结果—业务动作—人工结论”。只有审核命中后真的阻止或分流了请求,接入才算完成。
常见问题
Moderation 通过就能直接发布吗?不能。它只提供信号,产品仍需处理版权、隐私、事实准确性和行业规范。
能审核语音吗?当前该模型不直接分类音频;可先按合规流程转写,再审核文字,但这也不能覆盖音调、背景声等信息。本文示例未处理你的业务政策,阈值和人工流程需要你自己验收。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31606.html