一条 FAQ 的预览能发现局部问题,却不能说明整套客服知识是否覆盖常见提问。Intercom Fin 的 Batch Test 可以把一组问题放在同一轮测试里,查看回答、来源和自动化行为。下面给出上线前的操作与复盘方法;示例问句是虚构的,本文没有访问任何真实客户对话,也未在工作区运行测试。
先把问题集写成可复查的样子
给每个问题记录“真实用户问法或经审定的模拟问法、期望引用的政策、正确答案边界、负责人”。例如:示例“商品已签收,但订单页看不到退货申请入口,下一步怎么办?”期望回答应引用当前退货流程,并在资料不足时引导人工;不能自动编造可退天数。用正式客户对话建题时先按团队规则脱敏,避免把姓名、电话、订单号直接放进测试文件。

Intercom 的Batch Test 官方指南提供从近期会话、AI Topic、手动添加和单列 CSV 导入问句等方式。手动添加适合新政策或历史数据里没有的边界问题。官方当前写明一个测试组最多上传 50 个问题;这只是工具上限,不是建议固定测 50 条。
创建并运行一次批量测试
- 进入 Fin AI Agent → Test,选手动添加或上传单列 CSV。首轮可以从 8–12 条覆盖售前、物流、退货和人工接手的审定问句开始;这个数量是演示性编辑建议,并非官方门槛。
- 检查测试身份和语言。官方文档说明,默认用通用预览用户运行;如果你的答案依赖地区、客户等级或品牌,打开 Manage → Settings,选择相应 User or Lead 等身份,再比较结果。
- 运行后逐条看 Fin 的答案、引用内容与自动化触发。把“答错事实”“来源缺失”“该转人工却未转”“受众限定失效”分开记录,方便定位修复责任。
- 修正知识内容或规则后保留同一组问题重跑,对比前后结果。只有问题集不变、测试身份与来源版本可追溯,回归对比才有意义。
官方说明要求使用 Batch Test 的团队成员有 full seat,且会话访问权限为 All conversations。从历史会话自动生成问句还依赖近期会话和额外权限;按钮不出现时先查这些前提,不要把账号权限错误误判成 Fin 不支持测试。
怎样判断本轮是否可继续上线
给每条问题写出人工判定:关键政策是否准确、来源是否有效、没有资料时是否承认不确定、敏感情形是否按约定转人工。若一条严重问题仍可能给客户错误退款、价格或账户承诺,先修资料或路由,再重测;不能用其余问题通过来抵消它。对只涉及语气的轻微问题,也要记录修订但可按团队标准排序处理。
本轮完成的证据应是一份“问题 ID—预期答案依据—Fin 输出—实际引用—判定—修复与复测结果”的表,而不是一个笼统的“AI 回答不错”。真实上线后仍需继续抽查客户对话;Batch Test 是上线前和变更后的检查手段,不保证未来所有问法都正确。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/29955.html