想修改现有口播视频中的话,又不想重新录音拍摄?打开 Text to Video Lip Sync,上传人物视频、输入新脚本并选择声音。工具根据文字生成语音,让画面中的口型与新台词同步。下面结合已有原片和结果说明适用场景与操作方法。
为什么用文字改写口播视频?
信息变了,不必再拍一次
产品介绍录好后,价格、日期、功能名称或行动号召可能发生变化。只改几个词却重新布置机位和灯光,成本很高。用文字改写时,先确认新的说法,再沿用已经拍好的表演。
如果只需改长视频中的一段,先把该段导出为单独片段,生成后放回原剪辑。工具不会自动在完整时间线上找到并替换某一句;人物指向旧价格等画面动作也不会随台词改变。
一段真实表演,做出多个口播版本
创作者、教师或团队负责人可能需要针对不同课程、受众或每周更新制作多版开场。同一段自然、通用的人物动作可以搭配不同脚本,省去反复约拍,同时保留真实拍摄带来的临场感。
文字已经定稿、但没有最终录音时,选择文字流程;可以使用预置声音,也可以在获得许可后克隆声音。若已经录好完整台词并希望保留原本的语气和节奏,请看 上传音频替换口播教程。
准备另一种语言的版本
也可以先准备并审核译文,再选合适语言的声音生成新版本。人名、数字、语义和语气需在输入前确认;口型同步本身不会翻译原视频。更完整的语言工作流见 AI 视频配音教程。
选择能适配多种台词的源视频
源视频提供人物原有的动作、表情和构图,不必说出替换台词。本例复用一段 5.06 秒的口播片段,文字与声音生成的结果约 10 秒;它与上传音频教程使用同一原片,方便对比两种输入方式。
优先选你有权修改的素材。片段不一定要长,也不需要始终正脸、嘴部特写;判断重点是动作和表情是否自然,能否适配不同内容。这个视频工作流也能处理一些传统口型同步方法较难处理的镜头,不必因为短暂转头就直接排除素材。
普通姿态变化和谈话手势通常更通用;指向某个商品、突然惊讶或用手指计数,则可能只适合原本那句台词。视频输入保留原有身体动作和表情,主要改变说话同步;它不会重新生成整段表演。若要从图片重新生成动作和表情,则属于耗时更长的 Max 图片模型流程。
写好台词,再选择声音
输入前检查名称、数字、日期和发音。文字模式可选预置声音,也可上传或录制获授权的简短声音参考进行克隆。参考音频用于确定音色,并不是最终要照搬的完整台词。本例使用约 16 秒的英文参考录音:
声音参考
例如,把旧通知改成“培训现改为周五上午十点开始”。这只是说明如何写替换文本,不是下方旧演示视频的逐字台词。
生成并核对结果
打开 Text to Video Lip Sync,上传源视频、选声音、粘贴新台词并生成。先核对说出的文字,再从头观看原有动作和表情是否与新意思协调。
下方是现有的短片案例,展示“文字+声音参考”的输入路径;它不是长视频成果,也不是完整操作录屏。
原片与结果时长不必相同。较长脚本需要格外检查原有手势被选用或重复时是否突兀;若想直接看短原片生成较长视频的核验案例,请看 五秒原片与 39 秒结果。
常见问题
原视频必须说出新脚本吗?
不用。原视频提供拍摄好的动作和表情;新文字另行输入,再选择生成语音所用的声音。
一定要克隆声音吗?
不用。本例采用声音参考,但也可以选预置声音。只克隆你拥有或获准使用的声音。
什么时候应该上传音频而不是输入文字?
脚本已写好、最终录音还不存在时用文字。如果已有完整录音,想保留其中的语气、发音和节奏,请用上传音频流程。
同一原片能用于多份脚本吗?
可以。动作与表情越自然、越通用,越适合复用。每个结果仍要单独检查画面动作是否契合新台词。
最后更新:



