AI 内容审核工具怎么接入?用 OpenAI Moderation 检查文本与图片

调用 OpenAI Moderation 检查文本和图片,把 flagged 与分类结果映射到放行、拦截和人工复核。

OpenAI Moderation 可以检查文本和图片中的潜在有害内容。接入时不要只看一个总开关:先读取 flagged 和分类信息,再结合自己的社区规则决定放行、拦截或送人工复核。审核结果是风控信号,不是法律结论。

先跑通文本审核

from openai import OpenAI

client = OpenAI()
response = client.moderations.create(
    model="omni-moderation-latest",
    input="这里放待审核的用户文本",
)

result = response.results[0]
print("flagged:", result.flagged)
print(result.categories)

用三组自建样例验证:正常咨询、明显违反规则的文本、含糊但需要人工判断的文本。记录每组的预期处置,不要在生产环境用真实伤害内容做随意测试。

AI 内容审核工具怎么接入?用 OpenAI Moderation 检查文本与图片

把模型结果映射到业务动作

结果 建议动作
未触发且风险低 继续业务流程并保留最少必要日志
触发明确禁止类别 阻止发布,给用户可理解的提示
边界情况或高影响内容 进入人工复核,不自动做不可逆处罚

omni-moderation-latest 可处理文本和图片,但不审核音频。图片需要按官方格式传入;文件大小和输入限制应在接入当天重新核对。已知或疑似儿童性虐待材料不得发送给普通 Moderation API,应遵循专门的儿童安全处理要求。

验收不能只看准确率

  • 检查漏放:危险样例是否被错误放行。
  • 检查误伤:正常讨论是否被无故拦截。
  • 检查解释:用户能否知道下一步申诉或修改方式。
  • 检查降级:审核服务失败时,高风险入口是否进入安全状态。

本文依据 2026 年 10 月 1 日官方 Moderation 指南,未使用你的社区规则、图片和真实用户数据测试,因此不能替代你自己的风险评测。

相关问题

flagged 为 false 就一定安全了吗?

不能这样判断。应用仍需自己的规则、上下文判断和人工升级机制。

可以用它自动封号吗?

高影响处罚应加入证据、申诉与人工复核,避免单一模型信号直接决定。

参考:OpenAI Moderation

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31263.html

赞 (0)
AI小管家的头像AI小管家
ChatGPT 词向量怎么用?生成 Embeddings 并用余弦相似度验证检索
上一篇 1天前
智能体 Webhook 怎么接?验证 OpenAI 签名并防止重复处理事件
下一篇 1天前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部