已有文字稿怎么对齐录音?用 MFA 导出词级 TextGrid

用已核对文字稿和录音获取词音素时间边界,同时核对输入与输出边界。

当文字稿已经准确,目标只是让每个词对应录音时间,可以使用 Montreal Forced Aligner(MFA)。它把录音、文字、发音字典和声学模型放在一起求对齐;不会替你纠正一份错稿。下面以英语短句导出 TextGrid 为例,未运行声学模型。

录音与文字必须一一配对

新建 corpus/speaker1,放入 demo.wav 与同名 demo.lab。lab 内容写实际说出的“Please open the window.”,不要加入录音中没有的标点朗读或遗漏词。官方语料结构支持单音频配 lab,较长录音也可按 TextGrid 区间组织。目录可用于区分说话人;两人对话直接作为单人数据会增加排查难度。

已有文字稿怎么对齐录音?用 MFA 导出词级 TextGrid

使用相互兼容的字典与模型

mfa align corpus ./english.dict ./english_acoustic.zip aligned

english.dict 与 english_acoustic.zip 是需按所用 MFA 版本获取的本地资源路径,不是自动存在的文件。官方当前文档说明 3.4 开始引入新的模型格式,因此旧安装包、字典和新模型应先验证兼容。第一次跑前执行 mfa align –help 核对参数;输出默认长 TextGrid,也支持其他格式。

在波形上校正真实边界

用 Praat 打开 demo.wav 与对应 TextGrid,查看词层和音素层,把“open”开头与录音的辅音起始对照。示意验收记录可以写“某词边界提前,已按波形人工调整”,不要填写未经听辨的误差数字。停顿、连读和词尾辅音常难精确定位,对齐结果应作标注起点。

没有输出时先查输入证据

查同名文件、文字编码与日志中的未登录词(OOV),确认专名是否在字典中;不要用忽略错误选项把有问题的样本静默丢弃。全部词都偏移时,核对剪裁音频与文字是否来自同一版本。下一步保存原文字、自动 TextGrid 和人工修订版三份材料,再用修订边界制作字幕或分析语音。

参考资料

依据 2026-10-03 读取的官方资料整理:官方文档 1;官方文档 2。

Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/33092.html

赞 (0)
AI小管家的头像AI小管家
自己的声音怎么训练转换模型?用 RVC 区分训练音色与文字配音
上一篇 3小时前
AI 语音打分能看出什么?用 Azure 发音评估核对音素错误
下一篇 3小时前

相关推荐

联系我们

联系我们

1

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信
关注微信
分享本页
返回顶部