DeepSeek 直接估算字数容易与实际统计口径不一致。先明确你要的是 Unicode 字符数、汉字数还是英文词数,再用本地 Python 计算;模型 token 数不能当成文章字数。
准备输入与运行环境
Python 3.11 标准库即可。代码使用虚构短句“AI 学习,test 123!”做演示;真实文章保存为 UTF-8 的 article.txt 后替换 text 变量。先明确是否包括空格、换行、数字和标点。

给 DeepSeek 的任务说明
不要估算字数。请给 Python 统计代码,分别输出字符总数、不含空白字符数、基本 CJK 范围汉字数、按拉丁字母及内部撇号匹配的英文词数。说明各口径的限制,并给可手算的短句验证。
在本地运行与检查
将下面代码保存为 example_09.py。进入保存该文件的目录,在终端执行 python example_09.py。代码应由你检查后执行,按实际字段修改。
import re
text = "AI 学习,test 123!"
# 处理文件时:from pathlib import Path
# text = Path("article.txt").read_text(encoding="utf-8")
counts = {
"characters": len(text),
"non_whitespace": sum(not ch.isspace() for ch in text),
"basic_cjk": len(re.findall(r"[\u4e00-\u9fff]", text)),
"latin_words": len(re.findall(r"[A-Za-z]+(?:'[A-Za-z]+)*", text)),
}
print(counts)
assert counts == {"characters": 15, "non_whitespace": 13,
"basic_cjk": 2, "latin_words": 2}
哪种口径适合交稿
若要求“正文 1000 汉字,不含标点”,就以约定汉字范围统计,标题、参考文献和注释是否算入也要提前确定。若平台显示“字数”,先用这段短句验证该平台怎么计数,不能默认各个平台相同。
Emoji 和生僻字为什么麻烦
Python len 计数的是字符串中的 Unicode 码位,不等于用户感知的字符簇;组合字符或部分 Emoji 会含多个码位。示例汉字范围不包括所有扩展 CJK 字符。英文正则是简单规则,连字符、缩写和其他语言需要另定分词规则。
怎样确认结果正确
短句应输出字符总数 15、去空白 13、基本范围汉字 2、英文词 2。先手算短句,再替换真实正文。交稿时同时写明统计口径,例如“基本 CJK 汉字数,排除标点和标题”,不要只报一个没有定义的数字。
适用边界与常见问题
这是明确统计规则的演示,没有证明任何模型 token 计费量或上下文容量。字数达标不代表文章质量达标,不能通过重复文字补足统计值;平台口径不同应以实际交付要求为准。
资料依据
接口说明核验日期:2026 年 10 月 1 日。Python 正则表达式。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30234.html