当文字稿已经准确,目标只是让每个词对应录音时间,可以使用 Montreal Forced Aligner(MFA)。它把录音、文字、发音字典和声学模型放在一起求对齐;不会替你纠正一份错稿。下面以英语短句导出 TextGrid 为例,未运行声学模型。
录音与文字必须一一配对
新建 corpus/speaker1,放入 demo.wav 与同名 demo.lab。lab 内容写实际说出的“Please open the window.”,不要加入录音中没有的标点朗读或遗漏词。官方语料结构支持单音频配 lab,较长录音也可按 TextGrid 区间组织。目录可用于区分说话人;两人对话直接作为单人数据会增加排查难度。

使用相互兼容的字典与模型
mfa align corpus ./english.dict ./english_acoustic.zip aligned
english.dict 与 english_acoustic.zip 是需按所用 MFA 版本获取的本地资源路径,不是自动存在的文件。官方当前文档说明 3.4 开始引入新的模型格式,因此旧安装包、字典和新模型应先验证兼容。第一次跑前执行 mfa align –help 核对参数;输出默认长 TextGrid,也支持其他格式。
在波形上校正真实边界
用 Praat 打开 demo.wav 与对应 TextGrid,查看词层和音素层,把“open”开头与录音的辅音起始对照。示意验收记录可以写“某词边界提前,已按波形人工调整”,不要填写未经听辨的误差数字。停顿、连读和词尾辅音常难精确定位,对齐结果应作标注起点。
没有输出时先查输入证据
查同名文件、文字编码与日志中的未登录词(OOV),确认专名是否在字典中;不要用忽略错误选项把有问题的样本静默丢弃。全部词都偏移时,核对剪裁音频与文字是否来自同一版本。下一步保存原文字、自动 TextGrid 和人工修订版三份材料,再用修订边界制作字幕或分析语音。
参考资料
依据 2026-10-03 读取的官方资料整理:官方文档 1;官方文档 2。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/33092.html