MMAudio 根据已有视频和可选文字生成声音。适合给无声短片补环境声和事件音效;它并没有录下拍摄现场的真实声音,声音内容和发生时间都要重新核对。
给短片写事件表
示例是自己拍的八秒片段:前半段轻敲杯子,后半段拉开抽屉。记录两个动作在视频中的大概时间,不要把脚本预期当成实际发生时间。准备无隐私的授权原片,先按官方仓库安装环境及模型。本篇未执行模型,也不报告音画同步精度。

输入视频而非仅输入文字
python demo.py --duration=8 --video=clip.mp4 --prompt "A cup being tapped, then a drawer opening in a quiet room."
README 说明默认训练和输出时长为八秒,输出保存到 output,包含 FLAC 音频和 MP4。省略 –video 就变成纯文本生成声音,不能用来核对画面事件条件。实际模型与片长、画幅和设备要单独验证,不能凭 README 的单机示例保证显存够用。
在事件时刻检查声音
先静音看原片,再听生成声,最后带声音播放结果。分别核对轻敲时是否有对应瞬态、抽屉动作是否有滑动声、没有动作的地方是否凭空出现讲话或音乐。把视频事件时间与音效出现时间并列记录,不能仅看“MP4能播放”就签收。
音效不合适时改哪一项
声音类型错先改具体提示词,删掉与画面无关的情绪和音乐描述;事件时间错先检查实际输入是否截对片段和输出时长是否对应。大幅偏离默认训练时长可能降低效果,先缩短输入做对照。下一步只取一个容易听出的动作练习,保存无声原片和生成音轨;官方 README 的检查点许可为 CC-BY-NC 4.0,商业用途不能仅凭可生成判断许可。用于事实记录的音轨必须标明后加,不能冒充现场原声。
参考资料
依据 2026-10-03 读取的官方资料整理:官方文档 1。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/33044.html