要在本机把中文录音转成文字,Vosk 与 Whisper 都有开源方案,但准备方式不同。Vosk 的官方 Python 示例要求自己的 WAV 为 16 kHz、16 bit、单声道 PCM,并需选语言模型;Whisper 官方命令依赖 FFmpeg,按模型与语言运行。本篇帮助你用同一段录音比较部署前提与可用性,不替代已有的 Whisper 单工具教程。
先固定同一测试材料
准备一段有使用权、已人工听写参考文字的短中文录音,最好含人名、数字和一处背景噪声。保留原文件,并建立表格记录每个工具的安装环境、模型名称、文字输出、错误位置、运行是否成功。人名与号码若涉及隐私应先取得处理授权。不要拿两个完全不同的录音比较“谁更准”。

核对安装与输入前提
| 项目 | Vosk | Whisper |
|---|---|---|
| Python 环境 | 官方安装页列出其当时支持的 Python 版本与系统;先核对你正在使用的 wheel 和平台。 | 按官方 README 的安装说明建立独立环境,安装 ffmpeg。 |
| 模型准备 | 从官方模型列表选择中文模型并保留模型名称。 | 运行命令时选择具名模型;首次使用需要取得权重。 |
| 输入 | 官方 Python 样例要求 16 kHz、16 bit 单声道 PCM WAV;不符时需真正转码。 | 用官方命令让 FFmpeg 处理输入,不等于任何损坏文件都能读。 |
| 输出核验 | 检查是否有文本及词错、漏词。 | 检查生成文字及数字、人名、幻觉文本。 |
Vosk 安装页的 Python 支持说明较旧,不能把它当作当前所有操作系统的绝对结论。先在自己的目标系统建隔离环境安装,并记录成功或失败的真实结果。Whisper 官方 README 也不保证在低配置机器上流畅运行。
按官方入口试一段
Vosk 官方安装页提供 vosk-transcriber 命令与 Python 示例。先从官方模型页取得所需语言模型,再按当前安装版帮助确认语言参数;如果使用 Python 示例,输入 WAV 必须符合其格式要求。
vosk-transcriber --list-languages
vosk-transcriber -l zh -i sample.wav -o vosk.txt
Whisper 按官方 README 安装后,可选择具名模型和语言运行同一段文件;以下是命令格式演示,不是本文实测结果。
whisper sample.wav --model small --language Chinese --task transcribe
比较输出时,不要只看文字多少。逐句回听并把每处替换、遗漏和凭空添加记录在同一参考文本旁。若某工具在你的系统无法安装,这也是选型结果;不要用另一台设备上的宣传指标补上。短录音、口音或噪音不同,结论可能变化。
如何作出有条件的选择
需要自己掌握模型文件、输入格式和更轻量的离线集成时,先测试 Vosk;需要多语言模型和已有 Whisper 工作流时,先测试 Whisper。最终以你的目标系统能否安装、相同样本的错误位置、可接受的资源占用决定。两者的开源仓库与模型许可应分别核对,不能把软件开源等同于所有模型或数据可任意商用。本文未在同一机器上实测两者速度或准确率,因此不作排名。
来源与适用范围
以下官方资料核对于 2026 年 10 月 1 日。界面、模型和许可如有变化,以打开时的官方页面为准。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/31784.html