智能体评测集怎么做?从任务清单、通过条件到失败样本回归

从真实任务、业务边界和历史失败中构建智能体评测集,写清通过条件,保存工具调用与失败原因,并持续加入回归样本。

智能体评测集不是一批“随便问问”的提示词,而是一组可以重复执行、能明确判断通过或失败的真实任务。最实用的起点是:先从日志和人工处理记录中挑出代表性任务,为每条任务写清输入、可用资料、允许调用的工具、必须出现的事实、禁止动作和人工判定规则。这样改提示词、模型或工具后,才能知道能力是真的提高了,还是只在几个演示问题上看起来更顺。

先定义评测目标,再收集任务

不要先追求一个总分。先写一句可以验收的目标,例如:“售后智能体应在核对订单归属后查询物流;查不到订单或接口失败时转人工,不得编造物流状态。”OpenAI 的评测最佳实践建议尽早、持续地评测,让测试贴近真实任务分布,并把自动评分与人工判断结合起来。NIST 的 AI 风险管理框架也强调对 AI 风险进行持续管理,而不是上线前只检查一次。

智能体评测集怎么做?从任务清单、通过条件到失败样本回归

任务来源可按下面顺序收集:

  1. 真实高频任务:从脱敏日志中选用户经常提出的问题。
  2. 业务边界:加入缺少订单号、身份不匹配、知识库没有答案等情况。
  3. 工具失败:模拟超时、空结果和权限不足,检查是否正确停止或转人工。
  4. 历史失败样本:把线上误答和人工纠正过的案例放进回归集。

用一张表保存可重复的评测任务

下面是一个可直接复制的 CSV 表头。示例内容是虚构的售后场景,只用于说明字段,不代表真实客户数据或运行结果。

case_id,source,user_request,fixed_context,expected_tool,must_include,must_not,pass_rule,last_result,failure_reason
after_001,脱敏日志,"订单 A100 到哪了","订单属于当前用户;物流状态=运输中",get_logistics,"运输中","已签收|编造时间","先核对归属;调用物流工具;答复与工具结果一致",,
after_002,历史失败,"帮我查订单 B200","订单不属于当前用户",none,"无法查询该订单","订单详情|物流状态","不得调用物流工具;提示核对账号或转人工",,
after_003,边界设计,"订单 C300 到哪了","物流接口超时",get_logistics,"查询暂时失败|转人工","猜测物流状态","记录工具失败;不得把超时写成查询成功",,

每条记录只测试一个主要行为。把多个不相关要求塞进同一条任务,失败后很难判断是检索、工具、权限还是回答格式出了问题。

“通过条件”要能让两个人得到接近的结论

通过条件可以分成三层:

层级 适合自动检查的内容 适合人工检查的内容
硬门槛 是否调用正确工具、是否泄露禁止字段、是否在失败时停止 通常无需主观判断
事实正确 订单状态、金额、时间等是否与固定上下文一致 答案是否遗漏关键限制
表达质量 格式、字段是否齐全 是否清楚、是否给出合理下一步

如果规则只是“回答不错”或“看起来专业”,它不能稳定复测。先让两名评审分别判断一小批样本,再讨论分歧并改写规则。OpenAI 文档特别提醒不要采用“凭感觉评测”,也建议用人工反馈校准自动评分。

执行一次基线评测

  1. 冻结模型名称、提示词版本、工具版本和知识库快照。
  2. 逐条发送固定输入,保存模型原始回答、工具调用参数、工具返回和最终答复。
  3. 先检查硬门槛。发生越权、编造关键状态或把失败写成成功时,该条直接失败,不能用文案分数抵消。
  4. 再检查事实与表达,记录具体失败原因,例如“未核对订单归属”或“接口超时后编造状态”。
  5. 修改系统后,用同一批任务重新运行并比较;不要边改任务边比较结果。

OpenAI 的 evals 指南把流程概括为描述任务、用测试输入运行、分析结果并迭代。即使不使用任何特定评测平台,这个顺序仍适用于本地表格和自建脚本。

把失败样本加入回归集

每次发现新的真实失败,都复制输入和必要上下文,脱敏后新增为独立 case,并写明当时为什么失败、修复后应满足什么条件。不要覆盖旧任务,因为旧记录能证明修复是否反复退化。建议把评测集分成“开发集”和“保留集”:开发集用于日常调试,保留集只在阶段验收时运行,减少为了当前样本过度修改提示词的风险。

怎么判断这套评测集可以使用

先让同一版本连续跑两轮,确认输入、工具返回和判定过程都能复现;再故意制造一个工具超时和一个归属不匹配,检查这两条是否稳定失败或进入人工交接。如果同一条任务因为外部数据不断变化而无法比较,就把必要数据固定到测试上下文,或把它标为人工观察项,不能把不稳定结果当成模型提升。

这篇方法没有在你的业务系统或真实用户数据上运行,也没有提供一个适用于所有智能体的合格分数。评测集的任务分布、风险门槛和人工规则必须由实际业务负责人确认;医疗、金融、权限和资金操作还需要对应领域的专业审核。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/29717.html

赞 (0)
AI小管家的头像AI小管家
大模型、智能体、工作流有什么区别?用客服工单串起三者
上一篇 1天前
DeepSeek 蒸馏模型怎么选?从 Qwen 1.5B 到 Llama 70B 核对 6 个官方版本
下一篇 1天前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部