两个分类模型怎么比较?用同一测试集统计分歧与配对自助区间

比较两个分类模型时,先让它们预测同一批测试样本,再检查一条样本上的对错变化。下面统计模型分歧,并对准确率差 B−A 做配对自助重采样;每次抽取相同样本编号,保留两模型结果的对应关系。

比较两个分类模型时,先让它们预测同一批测试样本,再检查一条样本上的对错变化。下面统计模型分歧,并对准确率差 B−A 做配对自助重采样;每次抽取相同样本编号,保留两模型结果的对应关系。

环境与运行方法

本文代码在 Windows、Python 3.11 的本地独立环境执行通过。以下数据全部为人为构造的教学样本,不是客户数据,也不是业务效果测试。

两个分类模型怎么比较?用同一测试集统计分歧与配对自助区间

新建一个空目录,在终端执行安装命令,把后面的完整代码保存为 demo.py,再执行 python demo.py。文件输出均保存在运行目录,请先在空目录练习。

python -m pip install numpy==2.4.6

先核对样本编号、标签与顺序

true、pred_a、pred_b 的每个位置必须指向同一条样本。真实数据应按稳定编号连接并核对,不能仅凭三个列表长度一致就当作对齐。本例的12条标签与预测是人为设置,用于展示统计方法,没有训练模型。

分别统计 A错B对、A对B错和两者都错。整体准确率可能接近,但错误落在不同样本上;哪些错误更严重要按业务代价另查,不能只用整体比例决定上线。

对差值进行同索引重采样

先把每条样本上的变化写为 +1、0 或 -1:B正确而A错误为+1,反之为-1,两者同对或同错为0。每次从这12个变化值中有放回抽12条,再求均值,得到一次准确率差。

代码重复5000次,取2.5%和97.5%分位数,形成教学用百分位区间。不能分别给A和B独立抽样后相减,那会破坏配对关系。同一用户多条记录、时间依赖或测试集被反复调参时,还需改变抽样单位或评估设计。

可复制的完整代码

import numpy as np
y = np.array([0, 1] * 6)
a = y.copy(); a[[0, 1, 2, 3]] = 1 - a[[0, 1, 2, 3]]
b = y.copy(); b[[2, 4]] = 1 - b[[2, 4]]
ok_a, ok_b = (a == y), (b == y)
changes = ok_b.astype(int) - ok_a.astype(int)
rng = np.random.default_rng(12)
indices = rng.integers(0, len(y), size=(5000, len(y)))
boot_delta = changes[indices].mean(axis=1)
lo, hi = np.quantile(boot_delta, [0.025, 0.975])
print("accuracy_A_B", round(float(ok_a.mean()), 4), round(float(ok_b.mean()), 4))
print("A_wrong_B_correct", int((~ok_a & ok_b).sum()))
print("A_correct_B_wrong", int((ok_a & ~ok_b).sum()))
print("delta_B_minus_A", round(float(changes.mean()), 4))
print("paired_percentile_interval", [round(float(lo), 4), round(float(hi), 4)])
assert changes.sum() == 2 and len(y) == len(a) == len(b)
assert indices.shape == (5000, 12)

运行结果与核对方法

下面是本文教学代码在上述本地环境中的实际输出。浮点数末位可能随依赖版本变化。

accuracy_A_B 0.6667 0.8333
A_wrong_B_correct 3
A_correct_B_wrong 1
delta_B_minus_A 0.1667
paired_percentile_interval [-0.1667, 0.5]

核对 A错B对为3条、A对B错为1条,准确率差为2/12≈0.1667;区间若跨0,不把它写成“B已明确更好”。这只是重采样的不确定性提示,下一步回查四条改判样本,并用预先确定的代表性测试设计确认业务影响。

使用边界与常见问题

这是12条手工设定预测的教学演示,百分位区间在小样本下可能不稳定,没有证明模型B真实优于A。样本相关、标签错误、挑选测试集和反复比较都不由这段重采样自动解决。

能对训练集这样比较吗?

可以计算数字,但它不能代表独立测试性能。模型和参数选择应使用预先划定的验证数据,最终评估避免再被调参过程反复使用。

官方资料

接口与参数依据以下官方资料核对(2026年10月1日)。示例验证只覆盖本文输入和步骤。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30779.html

赞 (0)
AI小管家的头像AI小管家
电商 AI 分析怎么找商品搭配?计算购物篮支持度、置信度与提升度
上一篇 1天前
AI 训练标签怎么修改才可追溯?保存修改前后值和审核记录
下一篇 1天前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部