AI 训练数据集怎么清洗和切分?用 Datasets 过滤、映射并保存

用 Hugging Face Datasets 的 filter、map、train_test_split 和 save_to_disk 处理小型示例数据。

已有样本表时,可用 Hugging Face Datasets 做过滤、字段标准化和训练/验证切分。下面用三行虚构文本展示操作,目的是让读者跑通处理链;它不是可训练的真实数据集,也不能用于评估模型质量。

准备一份最小样本

先在 Python 环境安装 datasets,运行下列代码。实际项目中可按 官方加载说明从 CSV、JSON 或 Hub 读取,不必手写样本。

AI 训练数据集怎么清洗和切分?用 Datasets 过滤、映射并保存

from datasets import Dataset

rows = [
    {"text": "  客服回复很清楚  ", "label": 1},
    {"text": "", "label": 0},
    {"text": "等待时间较长", "label": 0},
]
ds = Dataset.from_list(rows)
print(ds.column_names, len(ds))

过滤、映射、切分与保存

按照 Datasets 处理文档,filter() 可筛行,map() 可按样本处理字段,train_test_split() 可切分,save_to_disk() 可保存结果。接在上段代码后:

clean = ds.filter(lambda row: bool(row["text"].strip()))
clean = clean.map(lambda row: {"text": row["text"].strip()})
parts = clean.train_test_split(test_size=0.5, seed=42)
parts.save_to_disk("processed-demo")
print(len(parts["train"]), len(parts["test"]))
print(parts["train"].column_names)

在这个玩具示例里,空文本会被过滤,首尾空格会移除,结果保存到 processed-demo。检查方法是看切分后两部分的行数合计是否等于清洗后行数,并抽查文本列是否仍有空串。官方文档说明处理方法返回新的 Dataset 对象,原始对象不会原地修改,因此要接住返回值。

正式数据还要检查什么

真实训练集不能只靠上述几行完成质量控制。先定义去重、异常标签、个人信息和许可的处理规则;再按任务选择切分方式,防止同一个用户、文档或时间序列同时出现在训练与验证集。小样本随机切分可能让某一类完全缺席,因此必须打印各 split 的类别分布后再投入训练。

如果字段名与示例不同,先查看 column_names 再改代码;如果出现过滤后样本为空、某类消失或保存目录不符合预期,停止后续训练并检查输入。本文没有拿这三行示例声称模型可训练或效果可评估。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/29863.html

赞 (0)
AI小管家的头像AI小管家
公开 AI 训练数据怎么获取?用 Hugging Face Datasets 加载并核对许可
上一篇 1天前
训练数据怎么做版本管理?用 DVC 跟踪数据文件并回退
下一篇 1天前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部