教程

用新脚本改写一段口播视频

FreeLipSync TeamFreeLipSync Team|3 min read
文字转视频口型同步教程封面:原始视频、克隆声音和新脚本工作流

这个 Text to Video Lip Sync 案例从一段自然口播视频开始,但不直接上传最终语音,而是先从短音频克隆声音,再用文字替换原视频中的台词。

原始视频

以下是本教程使用的原始视频。

原始视频要求

  • 自然说话的视频效果最好,原视频不必包含最终要说的台词。
  • 时长从约 5 秒到几分钟都可以。
  • 大部分镜头中应保持脸部可见。
  • 轻微、可信的动作是有帮助的。
  • 避免夸张手势、突然转头或大幅动作。

如果专门为这个工作流拍摄素材,保持简单自然即可。录制时只说“一、二、三”也可以;你不需要在镜头前背诵或表演最终脚本。

声音参考

以下短音频用于克隆说话风格:

声音参考输入

替换脚本

以下是演示实际使用的英文脚本,保留原文以准确对应生成结果:

That's it for today! Isn't this incredible? It's free, it's fast, it's u* — and you can even generate lip sync videos up to 60 minutes long.

这个方法适合以下情况:

  • 希望修改台词,但不想重新录音。
  • 需要快速本地化或修补一句话。
  • 希望新语音保持指定的声音身份。

生成结果

以下结果由原始视频、声音参考和替换脚本共同生成:

打开该结果的独立播放页

本教程说明了什么

  • 一段自然原视频可以复用于全新的台词。
  • 简短的声音参考即可定义新的声音身份。
  • 原始动作平静、可信时,文字改写的效果最好。

如何复现这个工作流

  1. 打开 Text to Video Lip Sync。
  2. 上传一段只有一个清晰人脸的自然口播视频。
  3. 上传一小段声音参考用于克隆。
  4. 粘贴希望视频说出的新脚本。
  5. 生成并检查新台词在原镜头中是否自然可信。

Related