知识库问答测试应把“找对资料”和“根据资料答对”拆开。一个回答看起来正确,仍可能引用旧版、没有出处,或靠模型常识猜中。下面是一份可复制的验收表设计;示例制度均为虚构,不能当作真实业务规则。
先固定资料与预期
给测试知识库放入《报销规则 v2》与《报销规则 v1》,并给每个可核对事实标注文件、段落和生效状态。假设 v2 写着“员工提交报销单后由直属主管审批”,v1 写着“由部门助理审批”。用下表保存测试问题,避免改了知识库却换一套问题比较:

case_id,question,expected_source,expected_fact,expected_behavior
qa_01,现在报销单由谁审批,报销规则v2/审批流程,直属主管,引用v2并回答
qa_02,旧版由谁审批,报销规则v1/审批流程,部门助理,明确说这是旧版
qa_03,私人旅游能报销吗,无,无,说明资料未提供依据
这份表是格式样例,不是一次真实测试结果。若系统禁止展示旧版资料,第二题应改为“不得返回旧版内容”;预期由实际权限与业务规则决定。
逐层验收,而不是只看一句回答
- 检索命中:对每题保存候选片段的文件名、段落和排序。
qa_01至少应找到 v2 的审批段;找不到时记录“检索失败”,即使模型猜对“直属主管”也不能算过。OpenAI Retrieval 指南展示了带来源与相关片段的搜索结果,便于把检索层单独检查。 - 答案忠实与引用:逐句把答案中的人、数值、条件映射到命中的原文;引用链接或文件标识必须能打开并定位。答案写“直属主管审批”却引用 v1,应判失败。Ragas 的Faithfulness 指标说明也把回答中的陈述是否有检索上下文支持作为独立检查角度;人工终审仍要看原文。
- 无依据拒答:
qa_03没有授权资料支持时,应明确说当前资料无法确认,并提示找制度负责人,不得编造报销资格。把这类问题和含糊、跨版本、越权问题一起放入回归集。OpenAI 评估最佳实践建议使用代表实际输入的数据并持续回归,而不是只凭几次“感觉不错”的对话。
记录失败并复测
每轮保存知识库版本、分段策略、检索参数、提示词版本、原始问题、候选片段和最终回答。修改一项后,用同一批问题重跑;把失败归到“源资料缺失、检索错误、引用错误、答案无依据”四类。若含个人或内部资料,测试账号必须只检索其有权访问的内容;越权命中本身即失败,不能靠最终回答隐藏。本文给的是验收模板,未运行读者系统,也不提供虚构通过率。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/29878.html