Token 概率是模型在给定上下文里选择下一个词表项的分布。它回答“接下来倾向生成什么”,不能直接回答“整段内容有多正确”。下面用不需下载模型的数值例子,核对 logits、softmax 与温度的关系。
从分数变成概率
logits 是未归一化分数,允许负数,也不要求总和为一。为避免大数溢出,计算 softmax 前先减去最大值;温度 T 大于零时将分数除以 T。示例三个候选只是人为指定的标签,不对应真实模型词表。

运行同一组候选
import math
def softmax(xs, temperature=1.0):
if temperature <= 0:
raise ValueError("temperature must be positive")
ys = [x / temperature for x in xs]
m = max(ys)
exp = [math.exp(x - m) for x in ys]
return [x / sum(exp) for x in exp]
for t in (0.5, 1.0, 2.0):
p = softmax([2.0, 1.0, 0.0], t)
print(t, [round(x, 4) for x in p], sum(p))
T=1 时约为 [0.6652, 0.2447, 0.0900]。总和应接近 1;T=0.5 更集中,T=2 更平坦。三个候选排序没有改变,但采样结果可能改变。温度不会凭空加入新知识。
看真实模型输出时再分两层
Transformers 生成文档区分未经处理的 logits 和经过生成处理的 scores。要检查模型原始偏好,先记录输出字段及生成参数;top-k、top-p、重复惩罚或其他处理会改变可采样集合。不要把裁剪后的三项概率当完整词表概率,也不要把普通分数未经归一化就标上百分号。
怎样核对一个业务问题
给同一个短上下文固定模型和分词器版本,保存候选 ID、解码后的字符串、原始分数和处理参数。遇到一个汉字被拆成多个子词时按 Token 记录,别把第一片段概率误称整个词的概率。若想判断回答可靠性,应另备真值与任务评估;下一 Token 的高概率不能替代事实核查。本文只演示数学分布,未调用线上模型。
参考资料
本文依据 2026 年 10 月 3 日读取的官方项目或文档整理。上面的输入均为教学示例,实际结果需按自己的版本和素材核对。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/33021.html