如果录音不方便上传,Whisper 可以在电脑上把中文声音转成文字,再输出带时间轴的字幕文件。这里采用官方开源程序,先下载依赖和模型,再处理本地音频;无需 OpenAI API Key。第一次安装和下载模型需要网络,完成缓存后才能检查断网运行是否可用。
本文适合能使用终端的 Windows 用户,示例环境为 Python 3.11、CPU 推理和 multilingual base 模型。命令依据 2026 年 10 月 1 日核对的官方文档及代码编写,没有在读者的电脑或录音上做实测;不承诺识别速度、正确率或任意硬件都能运行。

一、准备环境:先让 Python 和 FFmpeg 可用
Whisper 的 Python 包名是 openai-whisper,不要误装名称相近的其他包。下面固定使用 20250625 发布版。FFmpeg 是读取音频用的独立程序,需要能在终端直接调用。打开 PowerShell,执行:
py -3.11 --version
ffmpeg -version
py -3.11 -m venv .venv-whisper
.\.venv-whisper\Scripts\python.exe -m pip install --upgrade pip
.\.venv-whisper\Scripts\python.exe -m pip install openai-whisper==20250625
.\.venv-whisper\Scripts\whisper.exe --help
上面采用虚拟环境中程序的完整相对路径,因此无需修改 PowerShell 的脚本执行策略。若 py -3.11 不存在,先安装对应 Python,再重开终端。若 ffmpeg 提示找不到命令,先安装 FFmpeg 并将它的 bin 目录加入 PATH;官方安装说明列有 Chocolatey 和 Scoop 的方法,已经使用其中某个包管理器的用户可按说明安装。安装来源和命令见 Whisper 官方 README。
安装结束后,--help 应显示模型、语言、输出格式等选项。如果这一步失败,先解决依赖问题,不要把长录音交给一个尚未启动成功的环境。
二、先用短中文录音下载模型并转写
准备一段自己有权处理、能听清的中文录音,命名为 sample-zh.wav,放到当前目录。首次建议使用一分钟左右的片段,包含正常讲话和几个需要检查的数字或术语。先执行:
.\.venv-whisper\Scripts\whisper.exe sample-zh.wav --model base --model_dir .\models-whisper --device cpu --fp16 False --language Chinese --task transcribe --output_dir .\out-whisper --output_format all
base 是多语言模型;中文不要选 base.en 等仅英语模型。--language Chinese 指定录音的语言,--task transcribe 表示保留原语言转写。CPU 路径使用 --fp16 False,把模型缓存与结果分别放在明确目录,便于以后复用和排查。
官方 CLI 接受 txt、srt、vtt、tsv、json 等输出格式;此处的 all 会生成该版本支持的多种结果。参数依据见 官方转写代码。如果只需要字幕,把最后一项改成 --output_format srt;只需要文字则改成 txt。
三、检查文字与时间轴,再判断能否断网使用
运行结束后,打开 out-whisper\sample-zh.txt 和 out-whisper\sample-zh.srt。先确认两份文件不是空的,再回听开头、中间、结尾以及含数字、人名、否定词的句子。字幕还要检查时间是否递增、开始时间是否早于结束时间,以及文字是否大致跟随发音。文件生成只能说明处理流程走通,不能证明内容正确。
例如,录音里说的是“下周三以前不要提交”,必须核对“周三”和“不要”有没有被改错;句子通顺也可能表达了相反意思。SRT 是可编辑的字幕文件,不会自动把文字烧录到视频画面中。如果还需要在剪辑器里排版、校对和导出视频,可继续参考本站的 CapCut 字幕校对与时间轴教程;该教程走的是剪辑器内生成字幕的流程。
要验证离线能力,等依赖安装和 base 模型下载完成后断开网络,用同一个虚拟环境、同一个 --model_dir 和同一个模型重新运行上面的命令。能重新生成可读结果,才说明这套本地环境通过了断网检查。换成未缓存的模型、换用户或清理缓存后,仍可能重新下载。
官方开源代码这条路径处理的是本地文件,但“模型离线运行”和“整台电脑没有数据外发”是不同核验范围。录音也可能被云盘同步;敏感文件应检查自己的存储和同步设置。
四、常见失败怎么定位
| 症状 | 先检查什么 | 修复后如何确认 |
|---|---|---|
| 找不到 FFmpeg 或无法读取录音 | 重新执行 ffmpeg -version,检查文件路径、扩展名和录音能否正常播放 | 对同一短文件再次转写,确认输出包含实际讲话 |
| 首次运行一直等待 | 检查终端是否正在下载模型,模型目录是否可写、磁盘是否有空间 | 缓存完成后第二次运行不再重复下载同一个模型 |
| CPU 处理很慢 | 先用短片段和 base,必要时改 tiny;降低模型大小可能牺牲质量 | 同时记录完成时间和需要人工修正的错误,不能只看速度 |
| 模型把中文识别成英文 | 确认没有使用 .en 模型,并明确指定 Chinese 与 transcribe | 复查输出语言和关键原话是否一致 |
| 长静音出现不存在的句子 | 回听对应时间,判断是不是模型幻觉,不能直接保存为真实发言 | 删除或标记无音频依据的文字,并检查相邻段落 |
官方模型卡说明了语言表现不均、重复文字与幻觉等限制。本地运行没有消除这些问题,重要记录仍应保留原录音和人工校对稿。
补充问答
多人会议能直接给出姓名吗?
这个基础转写命令不负责把声纹对应到真实姓名。需要发言人标签时应另接说话人区分流程,并由知情人员回听确认;不要根据转写文本的语气推测谁说了哪一句。
想升级 GPU,是否只改 device 就够了?
还需要正确的 GPU 驱动与兼容 PyTorch 环境。先验证 GPU 能被框架识别,再改变推理配置。官方模型表的显存数字是近似值,不能用它保证某台机器一定能处理某个时长的录音。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30358.html