不要先看一个总分,先把检索质量与生成忠实度拆开。上下文精确率关注相关片段是否排在前面,忠实度关注回答中的主张能否由检索上下文支持;两者低分对应的修复位置不同。
两个指标回答不同问题
| 现象 | 先看 | 可能改哪里 |
|---|---|---|
| 检索返回很多无关片段 | Context Precision | 查询改写、过滤、排序、top-k |
| 已命中证据但回答添加新事实 | Faithfulness | 提示词、引用约束、拒答 |
| 关键证据根本没返回 | 还需 Context Recall 或人工命中检查 | 切片、嵌入、索引 |
Ragas 的 Context Precision 文档说明其衡量相关片段在检索结果中的排序;Faithfulness 文档把回答拆成主张,再检查这些主张是否能从检索上下文推导。

准备评估记录
{
"user_input": "退款多久到账?",
"retrieved_contexts": ["refund-v2#4: 审核通过后……"],
"response": "审核通过后按原支付渠道退回……",
"reference": "审核通过后按原支付渠道退回。"
}
字段名随 Ragas 版本可能变化,运行前按当前文档和安装版本核对。检索片段必须保留原顺序;把所有片段拼成一个无序大字符串会失去排序信息。
执行与验证顺序
- 先导出 20 条包含问题、检索上下文和回答的真实运行记录。
- 为需要参考答案的指标补上人工核验答案,不让生成模型自己给自己定标准。
- 先人工抽查五条,确认指标所用字段没有串行或截断。
- 按问题类型分组看结果,例如单跳、跨文档和不可回答,不用平均值掩盖某一类失败。
看到低分后怎么改
若上下文精确率低,先固定生成模型,只调整过滤和排序;若检索片段正确但忠实度低,固定检索结果,只调整回答约束。每次只改一个环节,然后用相同数据复跑,并保留版本、模型和参数。
限制
本文依据 Ragas 文档说明评估流程,没有在读者的数据集和模型上运行分数。自动指标本身也可能受评审模型影响;高风险答案仍需人工检查证据与结论是否一致。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32254.html