测试集的核心不是收集很多问题,而是把问题与当时有效的证据绑定。DeepSeek 只负责生成答案时,检索是否正确仍要单独检查;否则一个看似流畅的答案会掩盖漏检索。
每条样本保存什么
{
"id": "qa-001",
"question": "试用期可以开具发票吗?",
"evidence_ids": ["billing-v3#p12"],
"reference_answer": "可以,需在控制台提交抬头。",
"answerable": true,
"knowledge_version": "2026-10-01",
"tags": ["计费", "单跳"]
}
若资料没有答案,把 answerable 设为 false,evidence_ids 留空,并写明期望行为是拒答或转人工,不能杜撰参考答案。

覆盖三种问题
至少准备三类:可直接回答、需要跨片段回答、资料中无法回答。再加入缩写、口语、省略条件和相近产品名,检查查询表达变化是否导致漏召回。不要从文档标题机械改写所有问题;真实用户常常不知道官方术语。
制作步骤
- 先从 30 条真实咨询开始,每条只写一个明确任务。
- 由熟悉资料的人选择证据片段,记录稳定文档 ID、段落 ID 与版本。
- 让另一位复核者只看问题和证据,确认参考答案没有引入证据外信息。
- 冻结该版资料,再运行检索与 DeepSeek 生成,分别保存结果。
OpenAI 的 Evals 指南强调用代表性数据、任务特定指标和持续评估改进应用,这套原则与具体生成模型无关。DeepSeek 请求格式和当前模型以 官方 API 文档为准。
验收与失败定位
固定知识库版本后逐条运行,保存检索片段 ID、模型回答与是否通过。证据未命中是检索失败;证据命中但答案出现证据外断言是生成失败;不可回答样本仍强答是拒答策略失败。三类结果分开统计,修复后只改一个变量再复跑。
限制
示例数据是演示结构,不是对任何真实业务的实测结果。涉及医疗、金融或内部制度时,参考答案需要有权限的专业人员签审;文档更新后旧证据版本不能直接继续当金标准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32250.html