这个 Text to Video Lip Sync 案例从一段自然口播视频开始,但不直接上传最终语音,而是先从短音频克隆声音,再用文字替换原视频中的台词。
原始视频
以下是本教程使用的原始视频。
原始视频要求
- 自然说话的视频效果最好,原视频不必包含最终要说的台词。
- 时长从约 5 秒到几分钟都可以。
- 大部分镜头中应保持脸部可见。
- 轻微、可信的动作是有帮助的。
- 避免夸张手势、突然转头或大幅动作。
如果专门为这个工作流拍摄素材,保持简单自然即可。录制时只说“一、二、三”也可以;你不需要在镜头前背诵或表演最终脚本。
声音参考
以下短音频用于克隆说话风格:
声音参考输入
替换脚本
以下是演示实际使用的英文脚本,保留原文以准确对应生成结果:
That's it for today! Isn't this incredible? It's free, it's fast, it's u* — and you can even generate lip sync videos up to 60 minutes long.
这个方法适合以下情况:
- 希望修改台词,但不想重新录音。
- 需要快速本地化或修补一句话。
- 希望新语音保持指定的声音身份。
生成结果
以下结果由原始视频、声音参考和替换脚本共同生成:
本教程说明了什么
- 一段自然原视频可以复用于全新的台词。
- 简短的声音参考即可定义新的声音身份。
- 原始动作平静、可信时,文字改写的效果最好。
如何复现这个工作流
- 打开 Text to Video Lip Sync。
- 上传一段只有一个清晰人脸的自然口播视频。
- 上传一小段声音参考用于克隆。
- 粘贴希望视频说出的新脚本。
- 生成并检查新台词在原镜头中是否自然可信。



