Whisper 的 translate 任务可以把中文等非英语录音直接转成英文初稿,目标语言固定为英语。它不是任意语言互译按钮:--language Chinese 指的是输入录音语言,不是要求输出中文。最容易选错的是 turbo 模型,官方明确说明它没有接受翻译任务训练,即使指定 translate 也可能仍返回原语言。
下面用同一段中文录音分别生成原文和英文,方便回查误译。示例面向能使用终端的用户,采用 Python 3.11、CPU 和多语言 medium 模型。内容依据 2026 年 10 月 1 日核对的官方材料编写,未对示例录音运行模型;译文示例是人工构造的核对演示,不是实测效果。

一、先确认任务和模型没有选反
| 要做的事 | task | 输出 |
|---|---|---|
| 把中文声音写成中文 | transcribe | 中文转写稿 |
| 把中文声音译成英文 | translate | 英文译稿 |
| 把英文声音译成中文 | 这条内置任务不直接提供该方向 | 先转写英文,再用独立翻译流程 |
使用多语言模型,不使用 tiny.en、base.en 等仅英语模型,也不使用 turbo 承担翻译。官方建议翻译使用 medium 或 large;本文选 medium 只是给出一个明确配置,不表示你的硬件一定能快速运行。任务方向与模型限制见 Whisper 官方使用说明。
二、准备依赖与一段可人工核对的中文录音
在 PowerShell 中建立单独环境,下面固定使用 openai-whisper 20250625 发布版。FFmpeg 必须已经安装并可直接运行;安装方法可查上面的官方说明。录音命名为 brief-zh.wav,放到当前目录,先使用自己有权处理的一段短录音。
py -3.11 -m venv .venv-whisper-translate
.\.venv-whisper-translate\Scripts\python.exe -m pip install --upgrade pip
.\.venv-whisper-translate\Scripts\python.exe -m pip install openai-whisper==20250625
ffmpeg -version
.\.venv-whisper-translate\Scripts\whisper.exe --help
首次运行需要下载模型,磁盘要留出缓存空间。CPU 可以作为入门验证路径,但大模型可能处理较慢;先完成短片段,记录真实耗时后再考虑长录音。不要把别人机器上的速度数字当成自己的交付时间。
三、同一个模型生成原文与英文,放入不同目录
先生成中文原稿:
.\.venv-whisper-translate\Scripts\whisper.exe brief-zh.wav --model medium --model_dir .\models-translate --device cpu --fp16 False --language Chinese --task transcribe --output_dir .\out-original --output_format txt
再生成英文译稿:
.\.venv-whisper-translate\Scripts\whisper.exe brief-zh.wav --model medium --model_dir .\models-translate --device cpu --fp16 False --language Chinese --task translate --output_dir .\out-english --output_format txt
完成后,中文在 out-original\brief-zh.txt,英文在 out-english\brief-zh.txt。目录分开可以避免相同文件名覆盖原文。需要字幕时,把两条命令的输出格式分别改成 srt,再检查各自时间轴;译文和原文的分句未必逐行一一对应。
这两次调用都直接读取音频。第二条不会读取并翻译第一条生成的中文稿,所以手动改好中文稿后,重跑 translate 不会自动继承你的修改。若需要术语完全受控,可在校对中文稿后另走文本翻译流程。参数语义依据 官方 CLI 代码。
四、用“事实是否相同”核对译文
下面是人工编写的练习句,不是模型输出。你可以照着录一小段,再检查工具有没有保留这些意思:
原句:请在下周三之前提交十五份样品,不要先付款。
人工参考译文:Please submit fifteen samples before next Wednesday. Do not pay in advance.
先对照音频修正中文原稿,再查英文中的数量 fifteen、截止时间 before next Wednesday 和否定动作 do not pay。把 fifteen 写成 fifty,或漏掉否定词,即使英语自然也属于不可接受的事实错误。无需强求译文与参考句逐字相同,但人物、数量、单位、时间、义务和否定关系必须一致。
建议建立三列校对表:音频时间位置、人工确认的中文、英文需改处。先抽查高风险信息,再完整听读最终稿;公开课程、客户材料或正式纪要,应由能理解两种语言的人确认。官方模型卡提示了幻觉和语言表现差异,翻译同样需要核验。
五、输出异常时按顺序排查
- 结果仍是中文:先检查模型是否为 turbo、命令是否确实包含
--task translate,再确认打开的是 out-english 文件。 - 译文完全不相关:检查录音是否有真实讲话、文件路径是否正确、language 是否匹配输入;长静音生成的文字要回听删除。
- 术语译法反复变化:保留原音、中文校对稿和英文稿,对照统一术语;不能用听起来更专业的猜测替代原话。
- 模型下载或内存失败:先处理缓存、磁盘和环境问题,再用较小的多语言模型对短样片验证流程;更小模型仍需重新检查翻译质量。
可以只保留英文吗?
临时阅读可以,但要对外发布或用于重要决策,应保存原录音与校对后的中文稿。出现歧义时,只有英文初稿无法证明原始讲话到底是什么。若最终成品是视频,还需要字幕长度、排版与导出复查,可参考本站的 视频翻译与本地化流程说明。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/30370.html