录音里有哪些声音?用 YAMNet 识别声学事件并回听核对

用 YAMNet 对 16 kHz 单声道 WAV 列出声音事件候选,回听核对类别和短事件漏检。

录音里是猫叫、讲话还是机器噪声,可用 YAMNet 先做声音事件分类,再回听核对。它预测的是 AudioSet 类别,不会把语音转成文字,也不会知道声音来自哪一只猫或哪台设备。先用一条合法的短 WAV 验证前处理,再决定是否用于批量素材筛查。

确认输入是 16 kHz 单声道 PCM

TensorFlow 官方教程要求 16 kHz 单声道 WAV,送入模型前把 16 位整数波形归一化到约 -1 至 1。下例假定 sample.wav 已满足这些条件,遇到其他采样率、立体声或 32 位浮点格式会明确报错,而不悄悄误喂模型。

录音里有哪些声音?用 YAMNet 识别声学事件并回听核对

python -m pip install tensorflow tensorflow-hub scipy numpy

跑通分类并打印候选

import csv
import numpy as np
import tensorflow as tf
import tensorflow_hub as hub
from scipy.io import wavfile

sr, pcm = wavfile.read("sample.wav")
if sr != 16000 or pcm.ndim != 1 or pcm.dtype != np.int16:
    raise ValueError("需要 16 kHz、单声道、16-bit PCM WAV")
waveform = pcm.astype(np.float32) / 32768.0
model = hub.load("https://tfhub.dev/google/yamnet/1")
with tf.io.gfile.GFile(model.class_map_path().numpy()) as f:
    labels = [row["display_name"] for row in csv.DictReader(f)]
scores, embeddings, spectrogram = model(waveform)
means = scores.numpy().mean(axis=0)
for index in np.argsort(means)[-5:][::-1]:
    print(labels[index], round(float(means[index]), 3))

保存为 classify_sound.py 后运行。首次执行需要下载模型;终端应列出五个类别及分数,而不是只有一行“识别成功”。官方教程对帧分数取平均得到整段候选;如果只有前半段有猫叫、后半段是车声,整段平均可能掩盖短事件,应截取有代表性的片段另跑。

回听与判断边界

把前五名标签与实际录音对照,记录听得到的事件和模型误报。例如机器运转声被列成交通噪声时,不能直接用标签入库。分数只是相对候选强度,不能当“猫叫概率 90%”宣传。换一条不同环境的短样片重复,检查是否把背景声当作主事件。

本例没有实测准确率;TensorFlow 官方教程展示的是声音事件类别而不是语音内容或声纹身份。若需要逐秒定位事件,应依据每帧分数和真实时间轴另做标注与回听,不能把整段平均类别当成所有时刻都发生。

来源与适用范围

以下官方资料核对于 2026 年 10 月 1 日。界面、模型和许可如有变化,以打开时的官方页面为准。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31793.html

赞 (0)
AI小管家的头像AI小管家
AI 语音克隆如何工作?从录音样本到合成结果核对
上一篇 2小时前
语音活动检测怎么做?用 Silero VAD 标出讲话区间并回听
下一篇 2小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部