“两段录音是不是同一个人”可用 SpeechBrain 预训练声纹模型做初筛。输出是模型分数与二分类判断,不是法律身份鉴定。口音、设备、背景噪声、短录音和合成声音都可能改变判断,先用本人授权的录音建立同人和异人对照。
准备可比较的文件
准备 speaker-a-1.wav、speaker-a-2.wav 两段同一人的清楚讲话,再准备 speaker-b.wav 作为不同人的反例;文件名是演示身份,需由人工先确认。模型卡说明其训练数据来自 VoxCeleb,预期 16 kHz 单声道。verify_files 会对文件做必要的重采样和单声道选择;如果自行调用底层 embedding 接口,须自己核查采样率与通道。

运行两组比较
在独立 Python 环境按 SpeechBrain 官方仓库和模型卡安装依赖,并选择适配本机的 PyTorch。以下模型 ID 和接口来自模型卡:
from speechbrain.inference.speaker import SpeakerRecognition
model = SpeakerRecognition.from_hparams(
source="speechbrain/spkrec-ecapa-voxceleb",
savedir="pretrained_models/spkrec-ecapa-voxceleb",
)
pairs = [
("speaker-a-1.wav", "speaker-a-2.wav", "同一人对照"),
("speaker-a-1.wav", "speaker-b.wav", "不同人对照"),
]
for left, right, label in pairs:
score, prediction = model.verify_files(left, right)
print(label, "score=", float(score), "same=", bool(prediction))
保存为 verify_speaker.py 后运行。首次加载要下载权重;网络或缓存失败是执行失败,不能解释为“不同人”。模型卡规定 prediction 为 1 表示预测同一人,0 表示预测不同;score 是比较分数,不是“相同的概率”,不要把 0.93 写成 93% 确信。
核对判断是否可信
先检查同人对照与异人对照的分数排序是否符合已知身份,再回听分数异常的录音,排查串音、背景声、严重压缩和样本太短。至少用多组经授权的同人和异人录音重复,记录错判条件;只看一组不能推出准确率。
本任务是比较两段已指定录音是否同一说话人,不生成会议的发言时间轴,也不会知道真实姓名。模型卡明确不保证迁移到其他数据集后的表现。涉及门禁、支付或处罚等高风险身份决定时,不把单次模型输出当成独立证据。本文未在真实身份核验业务中实测。
来源与适用范围
以下官方资料核对于 2026 年 10 月 1 日。界面、模型和许可如有变化,以打开时的官方页面为准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31781.html