让 DeepSeek 解释一组数字时,不要只给平均值。本例用 Python 同时计算样本量、均值和中位数,并观察一个极端值如何影响结果;描述性统计本身不能说明差异原因。
准备输入与运行环境
Python 3.11 标准库 statistics。虚构数据为 10、11、12、13、100,单位假设为分钟,只演示统计定义,不代表客户等待时间或真实调查。有效输入必须为有限数字,不把缺失值填零。

给 DeepSeek 的任务说明
请解释一组虚构时长 [10,11,12,13,100]。先给样本量、均值、中位数和范围,用 Python 复算。指出极端值对均值的影响;没有随机抽样和对照资料,不推断整体水平、因果或显著性。
在本地运行与检查
将下面代码保存为 example_15.py。进入保存该文件的目录,在终端执行 python example_15.py。代码应由你检查后执行,按实际字段修改。
import math
from statistics import mean, median
values = [10, 11, 12, 13, 100]
if not values or any(type(v) not in (int, float) or not math.isfinite(v) for v in values):
raise ValueError("需要非空的有限数字列表")
stats = {"n": len(values), "mean": mean(values), "median": median(values),
"min": min(values), "max": max(values)}
comparison = values[:-1] # 仅用于演示去掉 100 后的变化,不作为正式删除规则
print(stats)
print("without_100_mean", mean(comparison), "without_100_median", median(comparison))
assert stats["n"] == 5 and stats["mean"] == 29.2 and stats["median"] == 12
均值与中位数回答不同问题
均值 29.2 是总时长 146 除以 5,适合总量分配等问题;中位数 12 反映排序后的中间位置。大多数值集中于 10 到 13,不能把 29.2 解释为每条记录都接近这个值。
极端值不能为了好看而删除
去掉 100 后,均值与中位数都为 11.5,这只是敏感性演示。100 可能是录入错误,也可能是重要长尾样本;要依据来源和预先约定规则处理,同时保存原始结果和排除理由。
向模型提供哪些限制
除汇总数之外,告诉模型单位、样本来源、时间范围、是否同一对象重复测量。用五条方便样本不能判断全部用户,也不能从两个均值大小断言统计显著。需要比较时另定抽样与分析方案。
怎样确认结果正确
结果应为 n=5、mean=29.2、median=12、min=10、max=100。手算总和 146,再按排序定位第三个值 12;比较去掉 100 后的 11.5。检查模型解释是否明确样本范围、极端值影响和不能推断原因。
适用边界与常见问题
数字与时间单位都是假设示例,未用于真实人群、产品效果或模型评测。均值、中位数和样本量只是描述性统计,不能单独证明因果、总体代表性或统计显著性。
资料依据
接口说明核验日期:2026 年 10 月 1 日。Python 统计标准库。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30343.html