AI 文件分类先产生建议表,再由本地规则确认每个文件恰好出现一次、类别在允许范围内。不确定的文件应进入复核清单,不能自动归到“其它”后执行。
需要用AI分类文件但不希望误移动的读者。本文使用 Python 3.11 或以上版本的标准库,先验证一组人工构造的小样本。AI 负责提出实现或解释差异,结果由本地检查决定;这里没有把模型回答当成真实运行结果。

检查文件分类建议前,先定规则
分类输入由文件ID和已授权摘要组成,模型输出只接受file_id/category/needs_review。路径不交给模型生成,避免分类建议变成任意文件操作。
类别在示例中固定为invoice、manual与review。needs_review为真时必须放review,不能一面标注不确定、一面进入可执行清单。
输入ID清单本身也必须唯一,重复来源ID先拒绝。完整性检查关注漏项和重复项。只看返回数组长度无法区分“A出现两次、B没出现”。
给 AI 的输入要包含什么
把下面这份输入说明和你的实际样本一起交给可用的 AI 编程助手。示例只含虚构数据;对真实材料先去除账号凭据和个人信息。
生成分类建议校验器:输入ID清单与建议,类别白名单invoice/manual/review;每个ID恰好一次,不接受额外ID;needs_review必须bool,不确定项归review。只输出复核表,不移动文件。
要求模型保留检查条件,并把它认为缺少的业务定义列出来。若回答改变了输入字段、忽略异常分支或直接删除原材料,先要求修正,再运行。提示词的作用是缩小任务范围,验收仍以代码和数据为准。
保存并运行最小验证程序
下方程序把关键规则和验证用例放在同一个可复跑示例中,便于先理解输入如何变成输出,再用它检查 AI 给出的实现。
新建一个空目录,把下面代码保存为 check.py,在该目录打开终端,运行 python -X utf8 check.py。代码自带示例输入,不需要安装第三方库。
from collections import Counter
def validate(ids,rows):
if len(ids)!=len(set(ids)): raise ValueError('来源ID必须唯一')
if Counter(r['file_id'] for r in rows)!=Counter(ids): raise ValueError('文件覆盖不一致')
for r in rows:
if r['category'] not in {'invoice','manual','review'}: raise ValueError('类别未知')
if type(r['needs_review']) is not bool: raise ValueError('复核标记类型错误')
if r['needs_review'] and r['category']!='review': raise ValueError('不确定项必须复核')
return rows
rows=[{'file_id':'a','category':'manual','needs_review':False},{'file_id':'b','category':'review','needs_review':True}]
assert len(validate(['a','b'],rows))==2
print('review_ids',[r['file_id'] for r in rows if r['needs_review']])
try: validate(['a','b'],[rows[0],rows[0]])
except ValueError as e: print('blocked',e)
else: raise AssertionError('重复建议必须失败')
try: validate(['a','a'],[rows[0],rows[0]])
except ValueError: pass
else: raise AssertionError('重复来源ID必须拒绝')
怎样判断结果符合要求
复核清单只含b,重复a的建议必须失败。输出数量正确不能抵消文件ID覆盖错误。
下方是这份最小示例在本地执行得到的输出。它验证示例程序与断言的关系,不代表任何 AI 模型一次就能生成同样代码,也不构成性能或生产可靠性结论。
review_ids ['b']
blocked 文件覆盖不一致
分类正确性仍需人工标注样本比较;本程序只拦截结构与范围错误。
模型置信分数并非已校准概率,不能随意设一个值就自动移动。
哪些失败必须停下来处理
文件名与内容冲突时保留证据供复核,不能只按扩展名确定文档类型。
在文件移动前重新核对文件哈希,防止建议基于旧版本。
接入自己的任务前再核对一次
执行计划由应用根据file_id解析真实路径,并检查归属和目录边界。
先在副本输出映射与人工判定,再逐步扩大允许自动分类的范围。
资料与适用范围
Counter可以统计重复键;分类建议的完整性与业务类别需由应用自己校验。以下链接核对于 2026-10-03;运行环境及额外依赖按本文前述说明。
相关基础可阅读 Ollama 怎么搭建本地智能体?用工具调用完成文件查询并核对结果。本文的重点是检查文件分类建议,可以把两项检查作为不同步骤保留。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/33370.html