把文件上传到 Dify 后,DeepSeek 不会自动读到文件内容。对于 PDF、DOCX、TXT 等文档,可靠链路是“用户上传文件 → 文档提取器输出文本 → DeepSeek 节点引用文本 → Answer 返回结果”。只把文件变量直接塞进普通文本提示词,常会得到看似合理但没有读文件的回答。
先准备模型与应用
在 Integrations 的 Model Provider 中配置可用的 DeepSeek 模型凭证,并在一个 Chatflow 中启用 File Upload。官方 App Toolkit 文档当前列出的单个文档大小上限为 15 MB;实际工作区还可能受套餐或管理员配置限制。

准备一个小型测试文档,正文写入独一无二的标记,例如:验收码:DFY-4827,项目负责人:林青。不要先用几十页扫描 PDF,因为扫描件可能只有图片,需要 OCR,不能代表文本提取链路已经跑通。
连接文件变量与文档提取器
- 在 Start 或 User Input 中增加文件变量 document,先限制为单文件和文档类型。
- 添加 Document Extractor,将输入指向 document。
- 添加 LLM 节点并选择已配置的 DeepSeek 模型。
- 在提示词中通过变量选择器插入提取器的文本输出,不要手写一个相似变量名。
- 把 LLM 输出连接到 Answer。
你只根据“文档内容”回答。
如果内容中没有答案,回复“文档未提供”。
文档内容:{{文档提取器的 text 输出}}
问题:{{用户问题}}
用唯一标记证明模型真的读到了文件
上传测试文档后问:“项目负责人是谁?同时返回验收码。”预期答案必须同时包含“林青”和“DFY-4827”。随后换一份不含这两个值的文档再次提问,预期结果应是“文档未提供”。这组正反测试能排除模型靠上下文或常识猜中的情况。
结果验证还应查看运行详情:文档提取器输出中能找到验收码,DeepSeek 节点的输入确实引用了该输出。若最终答案正确但提取器为空,应判为未通过,因为下一份文档很可能失败。
常见失败逐项定位
- 提取器报类型错误:检查文件变量类型和允许后缀;音频、视频或图片不是普通文档文本。
- 扫描 PDF 输出为空:先做 OCR,或换成含真实文字层的 PDF 验证。
- 长文被截断:文件提取适合一次性小文档;内容超过模型上下文时,应改用知识库检索,不能把整本资料硬塞给模型。
- 模型答了文档外内容:加入“无依据就回答文档未提供”,并用负例文档回归。
适用边界
本文没有在你的 DeepSeek 账号中实测,模型可用性、上下文和费用以所选供应商为准。文件可能包含个人信息或商业秘密,上传前应确认数据处理政策。上传限制见 App Toolkit,变量和输出类型见 Document Extractor,模型配置见 Model Providers;资料核验日期为 2026-10-01。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32287.html