DeepSeek 统计字数不对怎么办?用 Python 区分字符数、汉字数和词数

先约定字符、汉字和英文词的统计规则,再用可手算短句和 Python 核验正文长度。

DeepSeek 直接估算字数容易与实际统计口径不一致。先明确你要的是 Unicode 字符数、汉字数还是英文词数,再用本地 Python 计算;模型 token 数不能当成文章字数。

准备输入与运行环境

Python 3.11 标准库即可。代码使用虚构短句“AI 学习,test 123!”做演示;真实文章保存为 UTF-8 的 article.txt 后替换 text 变量。先明确是否包括空格、换行、数字和标点。

DeepSeek 统计字数不对怎么办?用 Python 区分字符数、汉字数和词数

给 DeepSeek 的任务说明

不要估算字数。请给 Python 统计代码,分别输出字符总数、不含空白字符数、基本 CJK 范围汉字数、按拉丁字母及内部撇号匹配的英文词数。说明各口径的限制,并给可手算的短句验证。

在本地运行与检查

将下面代码保存为 example_09.py。进入保存该文件的目录,在终端执行 python example_09.py。代码应由你检查后执行,按实际字段修改。

import re
text = "AI 学习,test 123!"
# 处理文件时:from pathlib import Path
# text = Path("article.txt").read_text(encoding="utf-8")
counts = {
    "characters": len(text),
    "non_whitespace": sum(not ch.isspace() for ch in text),
    "basic_cjk": len(re.findall(r"[\u4e00-\u9fff]", text)),
    "latin_words": len(re.findall(r"[A-Za-z]+(?:'[A-Za-z]+)*", text)),
}
print(counts)
assert counts == {"characters": 15, "non_whitespace": 13,
                  "basic_cjk": 2, "latin_words": 2}

哪种口径适合交稿

若要求“正文 1000 汉字,不含标点”,就以约定汉字范围统计,标题、参考文献和注释是否算入也要提前确定。若平台显示“字数”,先用这段短句验证该平台怎么计数,不能默认各个平台相同。

Emoji 和生僻字为什么麻烦

Python len 计数的是字符串中的 Unicode 码位,不等于用户感知的字符簇;组合字符或部分 Emoji 会含多个码位。示例汉字范围不包括所有扩展 CJK 字符。英文正则是简单规则,连字符、缩写和其他语言需要另定分词规则。

怎样确认结果正确

短句应输出字符总数 15、去空白 13、基本范围汉字 2、英文词 2。先手算短句,再替换真实正文。交稿时同时写明统计口径,例如“基本 CJK 汉字数,排除标点和标题”,不要只报一个没有定义的数字。

适用边界与常见问题

这是明确统计规则的演示,没有证明任何模型 token 计费量或上下文容量。字数达标不代表文章质量达标,不能通过重复文字补足统计值;平台口径不同应以实际交付要求为准。

资料依据

接口说明核验日期:2026 年 10 月 1 日。Python 正则表达式。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30234.html

赞 (0)
AI小管家的头像AI小管家
DeepSeek 生成函数图像怎么落地?用 Python 画图并处理断点
上一篇 1天前
Label Studio 文本多标签怎么配置?让一条反馈同时标记多个问题
下一篇 1天前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部