Wav2Lip 将已有脸部视频的嘴部运动改为匹配已有音轨。它不负责翻译、克隆声音或从照片生成整个人物。下面用自己出镜短片和自己的录音做口型同步;未运行模型,合成视频应明确说明经过编辑。
先确认许可和输入条件
开源仓库声明仅用于个人、研究和非商业用途,不能因为权重可下载就用于商业宣传。准备正面、嘴部无遮挡的 own_face.mp4 与 own_voice.wav,两者均已获所需授权。不要混淆 README 开头的商业 API 与下面的旧开源模型,它们不是同一部署路径。

用开源推理入口执行候选
python inference.py --checkpoint_path checkpoints/wav2lip.pth --face own_face.mp4 --audio own_voice.wav --outfile results/own_sync.mp4
在仓库根目录按开源说明准备依赖、人脸检测模型和对应检查点,先核对 inference.py –help。–face 与 –audio 是两个独立输入;生成结果只是口型候选,不会把音轨内容自动校对成正确表达。输出路径不要覆盖原片。
检查口型、合成边缘与时间
选择包含 b/p/m 等需要闭口的声音位置,慢放观察唇部闭合是否与声音对应,再看下巴、牙齿和头部转动处是否有双嘴或边缘闪烁。最后完整播放,核对首尾、音轨内容与时长;只看一个静态截图不能证明同步。
错位时先改检测区域
官方建议可用 –pads 调整人脸区域,如增加下边界覆盖下巴;检测框过度平滑导致错位时可试 –nosmooth。每次只改一个参数并保存同一时间段对比,不承诺调整必然改善。大侧脸、遮挡或多人输入不适合期待无人工修补。下一步保留原片、音轨、合成标注与验收记录,不用候选冒充未经修改的真实讲话。
参考资料
依据 2026-10-03 读取的官方资料整理:官方文档 1。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/33145.html