動画のセリフを自分で用意した音声に差し替えるには、元動画と完成した録音を Audio to Video Lip Sync にアップロードします。FreeLipSync は元の演技から新しい音声に合う部分を選んで同期するため、数秒の素材から長く自然なトーク動画を作れます。元動画が長い場合は、動きと表情を残したまま発話を差し替えることもできます。
実例では 5.06 秒の元動画と 39.42 秒の音声から、39.44 秒の結果を作りました。
アップロード音声でセリフを差し替える理由
一度撮影して、何度もメッセージを作る
講座の導入、製品の更新情報、定期的なお知らせなど、新しい原稿ができるたびにカメラや照明を準備して撮り直すと、時間と費用がかさみます。いろいろなメッセージに合う自然な動きの短い動画を残し、次回からは音声だけを録り直します。映像には実際に撮影された動きと表情が残るので、短い素材でも長い結果を自然でリアルに見せられます。
同じ映像から複数の版を作る
対象者やキャンペーンに合わせて説明を変えたり、別の言語で伝えたりするときも、同じ元動画を使えます。各版の原稿と録音を先に確認してください。リップシンクは用意した音声に見た目の発話を合わせますが、翻訳そのものは行いません。
既存の長い動画の発話を更新する
授業や説明動画がすでに長い場合も、その映像を元に新しい録音を合わせられます。体の動きや表情は元映像に基づきます。この用途は別の実例動画を追加せず、ここでは文章で説明します。人物が図を指したり物を持ったりしているなら、新しいセリフもその動作と矛盾しないようにします。完成済みの編集の一部だけを変更する場合は、その区間を切り出して処理後に戻します。
再利用しやすい元動画を選ぶ
自分が所有する映像や編集許可のある既存素材を使えます。新たな撮影は必須ではありません。下の屋外映像は 5.06 秒で、結果に残る人物の動きと表情を提供します。
元動画と音声の長さを合わせる必要はありません。正面から口元を大きく撮る必要もありません。 複数のセリフに合う自然な仕草や、特定の言葉に縛られない表情を重視します。この動画入力の方法では体の動きや表情を作り直さず、撮影済みの演技を使って発話を同期します。一方、画像から動きと表情を新たに生成する Max モデルは、より時間がかかります。公開前には素材と人物の利用許可も確認してください。
差し替え音声を用意する
最終的な録音を最初から最後まで聴き、言葉、発音、話す速さを確認します。この実例の英語音声は 39.42 秒です。
39秒の差し替え音声
まだ録音がなく新しい台本だけがある場合は、文字でトーク動画を書き換えるチュートリアルを参照してください。多言語版では、翻訳と録音を事前に確認します。
動画と音声をアップロードする
- Audio to Video Lip Sync を開きます。
- 動きと表情を残したい元動画をアップロードします。
- Upload Audio を選び、完成した録音をアップロードして両方のファイルを確認します。
- 生成オプションを確認し、処理を開始します。
実際の操作画面には約 5 秒の元動画と 39 秒の音声が表示されています。スクリーンショットは処理中のもので、完成した動画は下で再生できます。

入力と結果を見比べる
結果は 39.44 秒で、音声とほぼ同じ長さ、元動画の約 8 倍です。
元動画の動きと表情が自然に残り、新しい発話と口の動きが録音に沿っているか確認します。さらに長い動画を作る際も、素材の長さより使い回しやすい自然な演技を選ぶことが大切です。
よくある質問
アップロード音声は元動画より長くても大丈夫ですか?
はい。この例では 5.06 秒の元動画と 39.42 秒の音声から 39.44 秒の結果を作りました。元の演技から適切な部分を音声に合わせるため、長さをそろえる必要はありません。
元動画がすでに長い場合もセリフを差し替えられますか?
はい。長い動画と新しい録音を使えます。全体の一部だけを変更するなら、その区間を切り出して処理し、編集に戻します。
短い動画を再利用しやすくする条件は何ですか?
さまざまなメッセージに合う自然な動きと表情です。長さや完全な正面の口元よりも、特定のセリフに依存しない演技が重要です。
画像用の Max モデルとの違いは何ですか?
動画入力は撮影済みの動きと表情を残して発話を同期します。Max は画像から動きと表情を新たに生成するため、より時間がかかります。
最終更新:



