RAG 智能体效果怎么评估?用 Ragas 检查上下文与答案忠实度

用 Ragas 分别评估检索上下文与答案忠实度,理解输入字段、结果含义和低分修复顺序。

不要先看一个总分,先把检索质量与生成忠实度拆开。上下文精确率关注相关片段是否排在前面,忠实度关注回答中的主张能否由检索上下文支持;两者低分对应的修复位置不同。

两个指标回答不同问题

现象 先看 可能改哪里
检索返回很多无关片段 Context Precision 查询改写、过滤、排序、top-k
已命中证据但回答添加新事实 Faithfulness 提示词、引用约束、拒答
关键证据根本没返回 还需 Context Recall 或人工命中检查 切片、嵌入、索引

Ragas 的 Context Precision 文档说明其衡量相关片段在检索结果中的排序;Faithfulness 文档把回答拆成主张,再检查这些主张是否能从检索上下文推导。

RAG 智能体效果怎么评估?用 Ragas 检查上下文与答案忠实度

准备评估记录

{
  "user_input": "退款多久到账?",
  "retrieved_contexts": ["refund-v2#4: 审核通过后……"],
  "response": "审核通过后按原支付渠道退回……",
  "reference": "审核通过后按原支付渠道退回。"
}

字段名随 Ragas 版本可能变化,运行前按当前文档和安装版本核对。检索片段必须保留原顺序;把所有片段拼成一个无序大字符串会失去排序信息。

执行与验证顺序

  1. 先导出 20 条包含问题、检索上下文和回答的真实运行记录。
  2. 为需要参考答案的指标补上人工核验答案,不让生成模型自己给自己定标准。
  3. 先人工抽查五条,确认指标所用字段没有串行或截断。
  4. 按问题类型分组看结果,例如单跳、跨文档和不可回答,不用平均值掩盖某一类失败。

看到低分后怎么改

若上下文精确率低,先固定生成模型,只调整过滤和排序;若检索片段正确但忠实度低,固定检索结果,只调整回答约束。每次只改一个环节,然后用相同数据复跑,并保留版本、模型和参数。

限制

本文依据 Ragas 文档说明评估流程,没有在读者的数据集和模型上运行分数。自动指标本身也可能受评审模型影响;高风险答案仍需人工检查证据与结论是否一致。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/32254.html

赞 (0)
AI小管家的头像AI小管家
DeepSeek RAG 测试集怎么做?从问题、证据片段到拒答样本
上一篇 1小时前
RAG 和 ChatGPT 是什么关系?分清模型知识、外部检索与引用
下一篇 1小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部