想把已有视频配成另一种语言,先翻译并审核台词,再把目标语言的成品录音,或译文加合适的声音,交给 AI 视频配音工具。FreeLipSync 会让画面中的说话口型与新语音同步;翻译原话不是这一步自动完成的。
本文以英语人物视频配西班牙语为例。译文已事先准备,示例使用西语成品音轨走 Audio 模式,下文也说明何时改用 Text 模式。
为什么给现有视频做多语言配音?
把讲解带给另一种语言的观众
课程导言、产品说明、客服解答或地区公告已拍好,但另一批观众需要自己的语言。保留原来的人物、场景和表演,只替换为审核过的目标语言语音,可以省去重拍。译文不应机械逐字对应;请熟悉目标语言的人核对术语、姓名、数字和语气。如果人物正指向某件东西,也要确认新台词仍与那个动作吻合。
一次拍摄,制作多个语言版本
获得授权的同一段人物素材可以分别搭配不同语言的脚本与音轨,减少重复布景、打光和约拍。画面里真实拍到的动作与表情会保留,不会为了新台词重新生成整段表演。因此,表情自然、手势较通用的原片更适合复用。本文仅展示英语到西语这一版,并非自动批量翻译案例。
控制另一种语言的发音与节奏
如果译文已确定,译者或配音员可先录成品,把停顿、重音、专有名词发音定下来,再进入口型同步。没有最终音轨时,可在 Text 模式中输入审核过的译文并选目标语言的预置声音或获授权的克隆声音。只改同一种语言的台词,请看 文字改写口播教程;已有录音且无需翻译说明,请看 上传音频替换口播教程。
英语原片到西语结果:实际输入与输出
示例使用为演示制作的虚构人物英语片段,原片约 7.96 秒。原话是:
Hello and welcome. In this short update, I will explain how our new workflow helps global teams share clear product messages.
在生成口型前,已准备并审核以下西班牙语译文:
Hola y bienvenidos. En esta breve actualización, explicaré cómo nuestro nuevo flujo de trabajo ayuda a los equipos globales a compartir mensajes de producto claros.
用已有西语预置声音把译文制成约 8.98 秒的音轨。它是提交给工具的成品配音,不是从英语原片提取的声音:
本例使用的西班牙语成品配音
下面是约 9 秒、未手工调整口型的结果。可以对照上面的西语台词听发音,再与原片比较人物的动作和表情。
西语比英语原片约长一秒,结果仍跟随西语音轨。不必仅为了匹配原片时长而删短译文:工具可以从拍好的表演中匹配适合新语音的部分。仍应检查手势、表情是否符合新意思;动作越具体,这一步越重要。
用成品音频制作自己的配音
- 选有权改编的视频。 确认素材及人物授权。重点看动作、表情能否配合译文;原片不必很长,也不要求一直正脸或嘴部特写。
- 翻译并审核台词。 请目标语言使用者检查意思、名称、数字、术语与语气,并核对画面动作或字幕是否与新话语冲突。
- 准备最终音轨。 录制获授权的配音员,或用匹配语言的预置声音、获授权的克隆声音朗读译文。上传前听完整段,确定停顿和发音。
- 上传并生成。 打开 AI 视频配音,上传原视频,选择 Audio,加入成品音轨并生成。本例走的就是这条路径。
- 检查后分享。 核对说出的词、发音和原有手势是否协调;画面文字、背景音乐及发布权限也需单独确认。
若只替换长片中的一小段,先导出该片段,生成后放回剪辑。工具不会自动在整条时间线上定位一句话,也不会自动改写画面文字、添加字幕或完成音乐混音。
什么时候改用译文文字?
译文定稿但尚未录制目标语言声音时,选择 Text,粘贴译文并选匹配语言的预置声音或获授权的克隆声音;工具会生成语音并同步口型。若已有发音、节奏都确定的成品录音,则选 Audio。两种模式都沿用原片的肢体动作和表情;短原片也可能支持较长台词,但动作越与某个瞬间绑定,越需要检查结果。较长片段的当前输入限制请查看 价格与方案。
常见问题
工具会自动把英语翻成西语吗?
不会。本例西语台词在生成前就已翻译和审核;工具负责让目标语言语音与画面同步。
示例用的是 Text 还是 Audio?
用 Audio。我们先用西语预置声音做好配音,再上传成品音轨。Text 模式则从审核过的译文生成语音。
新录音必须与原片一样长吗?
不用。本例英语原片约八秒,西语音轨和结果约九秒。请检查新时长下原有手势和表情是否自然。
可以上传配音员的录音吗?
可以,在 Audio 模式上传最终配音即可。使用声音和让人物说出新话语都应取得相应授权。
最后更新:



