回归模型 MAPE 为什么会暴涨?检查零真值并对照 MAE

MAPE 把每条回归误差除以对应真值的绝对值;真值接近零时,即使绝对误差只有1,也可能得到惊人的比例。scikit-learn 遇到零真值会返回很大的有限数,不是无穷大。下面用四条人工数据逐行计算,和 MAE 对照,找出“百分比误差暴涨”的来源。

MAPE 把每条回归误差除以对应真值的绝对值;真值接近零时,即使绝对误差只有1,也可能得到惊人的比例。scikit-learn 遇到零真值会返回很大的有限数,不是无穷大。下面用四条人工数据逐行计算,和 MAE 对照,找出“百分比误差暴涨”的来源。

准备环境与教学数据

以下代码已在 Windows 的 Python 3.11 独立环境运行。文中数据是人为构造或库自带的教学样本,不代表任何业务系统的效果;例子不调用在线大模型。

回归模型 MAPE 为什么会暴涨?检查零真值并对照 MAE

在空目录安装依赖,把完整代码保存为 demo.py,运行 python demo.py。使用现有 Python 环境时,先核对依赖版本。

python -m pip install numpy==2.4.6 scikit-learn==1.9.1

先看分母,而不是先调模型

示例真值为0、0.01、10、20,预测值分别都高1。四条记录的绝对误差完全相同,所以 MAE 等于1;但是0.01那行的相对误差已是100倍,零真值那行的百分比在数学上无法直接定义。

scikit-learn 的 mean_absolute_percentage_error 为避免除以零,用极小的分母返回很大的有限浮点数。它返回的是比例,不是已经乘100的百分数;例如0.5表示50%。不能在报表里把函数返回值0.5直接写成0.5%。

把逐行贡献和可读指标同时输出

代码分别计算每行的 MAPE 贡献、全体 MAPE、排除零真值后的 MAPE,以及全体 MAE。排除零真值只用于诊断贡献,不是可以悄悄改变正式指标的规则;如果业务中零值合理存在,先与业务方约定可解释的评价方案和异常样本处理。

MAE 与目标同单位,能帮助判断“误差其实只有1”这件事,但它也不单独说明相对误差是否可以接受。正式评估应报告样本范围、零值条数、目标量纲与选定主指标,必要时按目标值区间另看错误。

完整可运行代码

import numpy as np
from sklearn.metrics import (mean_absolute_error,
                             mean_absolute_percentage_error)

truth = np.array([0.0, 0.01, 10.0, 20.0])
prediction = np.array([1.0, 1.01, 11.0, 21.0])
absolute_error = np.abs(truth - prediction)
assert np.allclose(absolute_error, 1.0)
mae = mean_absolute_error(truth, prediction)
individual = [mean_absolute_percentage_error(
    truth[i:i+1], prediction[i:i+1]) for i in range(len(truth))]
mape_all = mean_absolute_percentage_error(truth, prediction)
nonzero = truth != 0
mape_nonzero = mean_absolute_percentage_error(
    truth[nonzero], prediction[nonzero])
assert np.isclose(mae, 1.0)
assert np.isfinite(mape_all) and mape_all > mape_nonzero
print("truth", truth.tolist())
print("absolute_errors", absolute_error.tolist())
print("mae_target_units", round(float(mae), 3))
print("row_mape_ratio", [f"{float(v):.3g}" for v in individual])
print("all_mape_ratio", f"{float(mape_all):.3g}")
print("nonzero_only_mape_ratio", round(float(mape_nonzero), 3))
print("nonzero_only_mape_percent", round(float(mape_nonzero) * 100, 1))

运行结果与核对

下列是本文代码在上述环境的实际输出。更换运行环境时,先核对输入、代码和断言,再比较输出数值。

truth [0.0, 0.01, 10.0, 20.0]
absolute_errors [1.0, 1.0, 1.0, 1.0]
mae_target_units 1.0
row_mape_ratio ['4.5e+15', '100', '0.1', '0.05']
all_mape_ratio 1.13e+15
nonzero_only_mape_ratio 33.383
nonzero_only_mape_percent 3338.3

核对 absolute_errors 四项都是1、MAE为1、零真值那行的 row_mape_ratio 是很大的有限值,并检查 nonzero_only_mape_percent 等于对应比例乘100。换成真实数据时,先统计零值和近零值数量,再决定主指标,不能为了让数字好看而临时删除这类样本。

适用边界

这是四条人为构造记录,没有训练任何模型。单独排除零真值只用于解释 MAPE 放大的来源,不代表正式评估可以这样筛样本。MAE 也不说明相对错误是否可接受,指标选择仍取决于目标量纲与业务成本。

常见问题

MAPE 输出 0.2,报表该写多少?

函数返回比例0.2,对应20%。展示为百分数时乘100并加百分号;零真值和近零真值仍需单独检查。

参考资料

以下接口行为依据官方文档核对于 2026 年 10 月 1 日;本文的运行结果仅覆盖上述教学输入。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31769.html

赞 (0)
AI小管家的头像AI小管家
模型验证前怎么查重复样本?用行指纹核对训练集和验证集
上一篇 2小时前
模型评估指标怎么自定义?用 make_scorer 在交叉验证中核对误差方向
下一篇 2小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部