中文文本没有天然的空格边界。做客服意图分类、关键词统计或站内搜索前,可以先用 jieba 把句子切成词,再检查领域词有没有被拆坏。这里比较精确模式、搜索模式和自定义词典:前者适合一般文本分析,搜索模式会补出更细的片段,自定义词典用于固定业务术语。三者都不能替代人工标注的正确切分。
准备一组有歧义的演示句
需要 Python 3 和 jieba。以下两句是人为编写的客服演示数据,不对应真实用户。先把脚本保存为 segment_demo.py,安装后运行;首次加载词典可能要等待片刻。

python -m pip install "jieba==0.42.1"
并排比较切分粒度
import jieba
samples = [
"智学云课堂无法打开课程回放",
"手机端订单退款进度在哪里查看",
]
for sentence in samples:
precise = list(jieba.cut(sentence, cut_all=False))
search = list(jieba.cut_for_search(sentence))
print("原句:", sentence)
print("精确:", " / ".join(precise))
print("搜索:", " / ".join(search))
print("可还原:", "".join(precise) == sentence)
jieba.add_word("智学云课堂", freq=100000)
after = list(jieba.cut(samples[0], cut_all=False))
print("加入业务词后:", " / ".join(after))
print("业务词保留:", "智学云课堂" in after)
官方项目说明 jieba.cut 用于分词,cut_for_search 适合搜索索引的较细粒度,add_word 可以动态增补词典。脚本不把搜索模式输出重新拼接成原句,因为搜索模式可能同时给出长词和短词,出现重叠;只对精确模式做“可还原”检查。
怎样判断结果对任务有用
这组演示句中,“智学云课堂”应在加入自定义词后成为一个词;具体其他词的边界随词典版本和 HMM 设置变化。验证时除了看 业务词保留: True,还要核对十到二十条真实授权语句:课程名、产品型号、订单状态等关键术语是否被拆开;用这些词做搜索时,查询与文档须采用同一分词方式。
若只为了搜索召回,可以在索引时保留搜索模式产生的细词,但不要把重叠词的数量当作原文词数。若用于文本分类,应固定词典版本,在训练集和线上推理使用同一规则;新词的加入可能改变旧样本的向量表示。
常见失败和下一步
如果业务词仍被拆开,先检查是否在分词前调用了 add_word,再确认标点、大小写和输入中是否有不可见空格。词典可以让特定词被识别,但不能理解“苹果”在手机投诉和水果咨询里的语义;这类歧义要靠上下文标注与下游任务验证。
下一步把演示句替换为获授权的客服样本,列出预期的关键切分,保存脚本输出及词典版本。本文只给出可运行示例,未在你的业务语料上实测准确率。
资料与适用范围
以下官方资料核对日期为 2026 年 10 月 1 日。工具界面、模型和套餐会变化,请以打开时的文档及账号实际页面为准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31609.html