OpenAI Moderation 可以检查文本和图片中的潜在有害内容。接入时不要只看一个总开关:先读取 flagged 和分类信息,再结合自己的社区规则决定放行、拦截或送人工复核。审核结果是风控信号,不是法律结论。
先跑通文本审核
from openai import OpenAI
client = OpenAI()
response = client.moderations.create(
model="omni-moderation-latest",
input="这里放待审核的用户文本",
)
result = response.results[0]
print("flagged:", result.flagged)
print(result.categories)
用三组自建样例验证:正常咨询、明显违反规则的文本、含糊但需要人工判断的文本。记录每组的预期处置,不要在生产环境用真实伤害内容做随意测试。

把模型结果映射到业务动作
| 结果 | 建议动作 |
|---|---|
| 未触发且风险低 | 继续业务流程并保留最少必要日志 |
| 触发明确禁止类别 | 阻止发布,给用户可理解的提示 |
| 边界情况或高影响内容 | 进入人工复核,不自动做不可逆处罚 |
omni-moderation-latest 可处理文本和图片,但不审核音频。图片需要按官方格式传入;文件大小和输入限制应在接入当天重新核对。已知或疑似儿童性虐待材料不得发送给普通 Moderation API,应遵循专门的儿童安全处理要求。
验收不能只看准确率
- 检查漏放:危险样例是否被错误放行。
- 检查误伤:正常讨论是否被无故拦截。
- 检查解释:用户能否知道下一步申诉或修改方式。
- 检查降级:审核服务失败时,高风险入口是否进入安全状态。
本文依据 2026 年 10 月 1 日官方 Moderation 指南,未使用你的社区规则、图片和真实用户数据测试,因此不能替代你自己的风险评测。
相关问题
flagged 为 false 就一定安全了吗?
不能这样判断。应用仍需自己的规则、上下文判断和人工升级机制。
可以用它自动封号吗?
高影响处罚应加入证据、申诉与人工复核,避免单一模型信号直接决定。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31263.html