客服工单只有“退款、物流、其他”三个固定标签时,先判断能否用带人工标签的文本训练一个可复核的传统分类基线;若还要求从自由文本中提取原因、解释依据或处理开放问题,再考虑大模型。下面用相同的工单样本展示两条路径各自需要检查什么。
准备与运行
本文只使用人工构造的教学材料,没有把示例结果当作真实项目效果。以下代码在 Windows 的 Python 3.11 独立环境执行通过。先在空目录运行安装命令,再将完整代码保存为 demo.py,执行 python demo.py。

python -m pip install scikit-learn==1.9.1
把选择变成可核对的条件
固定标签、已有可靠标注、输出频繁且格式稳定时,字符 TF-IDF 加线性分类器是低复杂度基线;先测独立样本错误,再谈是否足够。新标签常变、需要解释或抽取多字段时,可试大模型,但每条输出仍须验证标签集合、证据和拒答。没有真实调用与同集测试,不能宣称哪种路线更准或更省钱。
这里的十二条工单与标签是人工构造。脚本只训练本地传统分类器;“大模型输出”使用一条人工写的模拟 JSON,以展示字段校验,不是接口实测。它故意返回标签集合之外的“促销”,检查程序必须拒收。
按质量、成本和数据边界记录决策
正式选型至少准备一批未参与训练的工单,按退款、物流、其他分别看误判;同时记录每条处理延迟、实际调用价格、数据外发规则与人工复核量。复核工时可按待复核条数乘以每条平均分钟计算,连同推理或调用费用一起比较;若一条路线节省调用费却显著增加人工回看,就不能只看单次费用。传统模型的概率也不能直接当成已校准可信度。大模型可以用结构化输出约束字段,但结构合法仍不保证语义正确。
如果客户信息不能外发,应先走已批准的本地处理路径;若使用外部服务,需要核对数据处理条款和脱敏要求。无论哪条路线,都要为“无法判断”留出人工交接,而不是硬塞进其他标签。
完整代码
import json
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import make_pipeline
texts = ["我要退款", "申请退货退款", "钱什么时候退回", "不想要了退钱",
"快递到哪里了", "物流怎么不更新", "查一下包裹位置", "什么时候送到",
"谢谢客服", "我要开发票", "修改收货人", "请问营业时间"]
labels = ["退款"]*4 + ["物流"]*4 + ["其他"]*4
model = make_pipeline(TfidfVectorizer(analyzer="char", ngram_range=(2, 3)),
LogisticRegression(max_iter=500, random_state=7))
model.fit(texts, labels)
query = "想查快递位置"
print("local_baseline", query, model.predict([query])[0])
allowed = {"退款", "物流", "其他"}
mock_llm_output = '{"label":"促销","evidence":"优惠券可以用吗"}'
candidate = json.loads(mock_llm_output)
print("simulated_llm_output", candidate)
print("accepted", candidate.get("label") in allowed and bool(candidate.get("evidence")))
assert candidate["label"] not in allowed
运行结果与核对
下面是上述脚本在本地执行得到的输出;正式数据请按相同检查点复核。
local_baseline 想查快递位置 物流
simulated_llm_output {'label': '促销', 'evidence': '优惠券可以用吗'}
accepted False
本地分类器会给“想查快递位置”输出一个标签;人工构造的“促销”候选因不在允许标签集合而显示 accepted False。正式试点还需在同一未见工单集上分别检查错误、拒识和人工复核时间,本例不能据此选出赢家。
适用边界
十二条训练句不足以评估泛化能力,脚本没有调用大模型、比较真实准确率或真实费用。结构化字段校验只能拦住格式与标签越界,不能识别“物流”被误判为“退款”的语义错误。
常见问题
固定标签还需要大模型吗?
不一定。先让简单基线在独立样本上交卷;当标签不稳定、需要字段抽取或解释、错误成本较高时,再设计大模型与人工复核的对照实验。
参考资料
以下官方资料已于 2026 年 10 月 1 日核对,分别用于确认文中接口或方法定义。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31718.html