已有样本表时,可用 Hugging Face Datasets 做过滤、字段标准化和训练/验证切分。下面用三行虚构文本展示操作,目的是让读者跑通处理链;它不是可训练的真实数据集,也不能用于评估模型质量。
准备一份最小样本
先在 Python 环境安装 datasets,运行下列代码。实际项目中可按 官方加载说明从 CSV、JSON 或 Hub 读取,不必手写样本。

from datasets import Dataset
rows = [
{"text": " 客服回复很清楚 ", "label": 1},
{"text": "", "label": 0},
{"text": "等待时间较长", "label": 0},
]
ds = Dataset.from_list(rows)
print(ds.column_names, len(ds))
过滤、映射、切分与保存
按照 Datasets 处理文档,filter() 可筛行,map() 可按样本处理字段,train_test_split() 可切分,save_to_disk() 可保存结果。接在上段代码后:
clean = ds.filter(lambda row: bool(row["text"].strip()))
clean = clean.map(lambda row: {"text": row["text"].strip()})
parts = clean.train_test_split(test_size=0.5, seed=42)
parts.save_to_disk("processed-demo")
print(len(parts["train"]), len(parts["test"]))
print(parts["train"].column_names)
在这个玩具示例里,空文本会被过滤,首尾空格会移除,结果保存到 processed-demo。检查方法是看切分后两部分的行数合计是否等于清洗后行数,并抽查文本列是否仍有空串。官方文档说明处理方法返回新的 Dataset 对象,原始对象不会原地修改,因此要接住返回值。
正式数据还要检查什么
真实训练集不能只靠上述几行完成质量控制。先定义去重、异常标签、个人信息和许可的处理规则;再按任务选择切分方式,防止同一个用户、文档或时间序列同时出现在训练与验证集。小样本随机切分可能让某一类完全缺席,因此必须打印各 split 的类别分布后再投入训练。
如果字段名与示例不同,先查看 column_names 再改代码;如果出现过滤后样本为空、某类消失或保存目录不符合预期,停止后续训练并检查输入。本文没有拿这三行示例声称模型可训练或效果可评估。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/29863.html