DeepSeek RAG 测试集怎么做?从问题、证据片段到拒答样本

为 DeepSeek RAG 建立可重复测试集,记录问题、证据片段、参考答案、不可回答标记和版本。

测试集的核心不是收集很多问题,而是把问题与当时有效的证据绑定。DeepSeek 只负责生成答案时,检索是否正确仍要单独检查;否则一个看似流畅的答案会掩盖漏检索。

每条样本保存什么

{
  "id": "qa-001",
  "question": "试用期可以开具发票吗?",
  "evidence_ids": ["billing-v3#p12"],
  "reference_answer": "可以,需在控制台提交抬头。",
  "answerable": true,
  "knowledge_version": "2026-10-01",
  "tags": ["计费", "单跳"]
}

若资料没有答案,把 answerable 设为 false,evidence_ids 留空,并写明期望行为是拒答或转人工,不能杜撰参考答案。

DeepSeek RAG 测试集怎么做?从问题、证据片段到拒答样本

覆盖三种问题

至少准备三类:可直接回答、需要跨片段回答、资料中无法回答。再加入缩写、口语、省略条件和相近产品名,检查查询表达变化是否导致漏召回。不要从文档标题机械改写所有问题;真实用户常常不知道官方术语。

制作步骤

  1. 先从 30 条真实咨询开始,每条只写一个明确任务。
  2. 由熟悉资料的人选择证据片段,记录稳定文档 ID、段落 ID 与版本。
  3. 让另一位复核者只看问题和证据,确认参考答案没有引入证据外信息。
  4. 冻结该版资料,再运行检索与 DeepSeek 生成,分别保存结果。

OpenAI 的 Evals 指南强调用代表性数据、任务特定指标和持续评估改进应用,这套原则与具体生成模型无关。DeepSeek 请求格式和当前模型以 官方 API 文档为准。

验收与失败定位

固定知识库版本后逐条运行,保存检索片段 ID、模型回答与是否通过。证据未命中是检索失败;证据命中但答案出现证据外断言是生成失败;不可回答样本仍强答是拒答策略失败。三类结果分开统计,修复后只改一个变量再复跑。

限制

示例数据是演示结构,不是对任何真实业务的实测结果。涉及医疗、金融或内部制度时,参考答案需要有权限的专业人员签审;文档更新后旧证据版本不能直接继续当金标准。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32250.html

赞 (0)
AI小管家的头像AI小管家
RAG 还是微调 DeepSeek?按知识更新、引用与任务行为做选择
上一篇 1小时前
RAG 智能体效果怎么评估?用 Ragas 检查上下文与答案忠实度
下一篇 1小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部