录音里是猫叫、讲话还是机器噪声,可用 YAMNet 先做声音事件分类,再回听核对。它预测的是 AudioSet 类别,不会把语音转成文字,也不会知道声音来自哪一只猫或哪台设备。先用一条合法的短 WAV 验证前处理,再决定是否用于批量素材筛查。
确认输入是 16 kHz 单声道 PCM
TensorFlow 官方教程要求 16 kHz 单声道 WAV,送入模型前把 16 位整数波形归一化到约 -1 至 1。下例假定 sample.wav 已满足这些条件,遇到其他采样率、立体声或 32 位浮点格式会明确报错,而不悄悄误喂模型。

python -m pip install tensorflow tensorflow-hub scipy numpy
跑通分类并打印候选
import csv
import numpy as np
import tensorflow as tf
import tensorflow_hub as hub
from scipy.io import wavfile
sr, pcm = wavfile.read("sample.wav")
if sr != 16000 or pcm.ndim != 1 or pcm.dtype != np.int16:
raise ValueError("需要 16 kHz、单声道、16-bit PCM WAV")
waveform = pcm.astype(np.float32) / 32768.0
model = hub.load("https://tfhub.dev/google/yamnet/1")
with tf.io.gfile.GFile(model.class_map_path().numpy()) as f:
labels = [row["display_name"] for row in csv.DictReader(f)]
scores, embeddings, spectrogram = model(waveform)
means = scores.numpy().mean(axis=0)
for index in np.argsort(means)[-5:][::-1]:
print(labels[index], round(float(means[index]), 3))
保存为 classify_sound.py 后运行。首次执行需要下载模型;终端应列出五个类别及分数,而不是只有一行“识别成功”。官方教程对帧分数取平均得到整段候选;如果只有前半段有猫叫、后半段是车声,整段平均可能掩盖短事件,应截取有代表性的片段另跑。
回听与判断边界
把前五名标签与实际录音对照,记录听得到的事件和模型误报。例如机器运转声被列成交通噪声时,不能直接用标签入库。分数只是相对候选强度,不能当“猫叫概率 90%”宣传。换一条不同环境的短样片重复,检查是否把背景声当作主事件。
本例没有实测准确率;TensorFlow 官方教程展示的是声音事件类别而不是语音内容或声纹身份。若需要逐秒定位事件,应依据每帧分数和真实时间轴另做标注与回听,不能把整段平均类别当成所有时刻都发生。
来源与适用范围
以下官方资料核对于 2026 年 10 月 1 日。界面、模型和许可如有变化,以打开时的官方页面为准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31793.html