Dify 的内容安全配置应同时考虑用户输入和模型输出。只拦输入,模型仍可能生成不合适内容;只审输出,恶意输入已经进入后续节点。最小可用方案是先定义规则和拦截响应,再用允许、拒绝和审核服务故障三类样例验证。
选择审核方式
在应用的 Features 面板打开 Content Moderation。Dify 当前提供 OpenAI Moderation、关键词和 Custom Endpoint 三种方式。关键词适合明确禁止的内部编号或敏感词;模型审核覆盖语义类别,但受供应商能力和地区影响;自定义端点适合企业已有规则引擎。

先分别启用输入与输出审核,并写清被拦截时的固定提示。提示只说明“内容无法处理”和可调整方向,不要回显命中的内部规则,也不要把原始敏感内容再次完整显示。
关键词规则先从小集合开始
为演示可放入两个测试标记:BLOCK-INPUT-927 用于输入,BLOCK-OUTPUT-614 用于输出。不要一开始导入巨大词表;同音、上下文和误伤会让规则难以维护。生产词表应有负责人、变更日期和申诉流程。
接自定义审核端点时核对协议
如果使用 Custom Endpoint,按 Dify 的 Moderation API Extension 约定实现请求和响应,并用独立测试环境验证鉴权。密钥放在扩展配置中,不能写在提示词或客户端。服务端还应限制请求大小、记录请求 ID,并对日志中的用户内容做脱敏。
六条用例验证输入和输出
- 普通问候,应通过并正常回答。
- 包含输入测试标记,应在调用 LLM 前被拦截。
- 不含完整标记的近似文本,应按设计通过,检查是否误伤。
- 让测试工具返回输出标记,应在展示给用户前被拦截。
- 审核端点返回超时,检查应用选择的是阻断还是失败提示。
- 超长输入,检查请求大小限制与错误信息。
内容安全通过的标准是:允许样例正常完成,输入违规不进入模型节点,输出违规不出现在最终回答,审核服务故障得到明确失败结果。到运行日志核对节点顺序,不能只凭页面上的一句提示判断。
边界与后续动作
内容审核不能替代账户权限、工具参数校验、人工复核和事件响应。高风险写操作应继续在后端做授权;日志也可能包含敏感信息,需要单独治理。本文测试标记只是演示,不是一份生产安全策略。
功能选项见 Dify App Toolkit,自定义审核协议见 Moderation API Extension。不同套餐和版本的入口可能变化,本文核验日期为 2026-10-01。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32295.html