このText to Video Lip Sync例では自然なトーキング動画から始めます。完成音声をアップロードする代わりに、短いサンプルから声をクローンし、テキストで台詞を置き換えます。
元動画
チュートリアルで使用した元動画です。
元動画の条件
- 自然に話す動画が最適で、完成台詞を含む必要はありません。
- 約5秒から数分程度で利用できます。
- 画面の大部分で顔が見える素材を使います。
- 小さく自然な動きは効果的です。
- 大げさな身振り、急な振り向き、大きな動作は避けます。
この用途のために撮影する場合は、シンプルで自然にします。「1、2、3」と言うだけでも十分で、完成台本を暗記して演じる必要はありません。
音声リファレンス
話し方をクローンするために、この短い音声を使います:
音声リファレンス入力
置き換える台本
デモで実際に使用した英語台本です。結果との対応を保つため原文のまま掲載します:
That's it for today! Isn't this incredible? It's free, it's fast, it's u* — and you can even generate lip sync videos up to 60 minutes long.
この方法が適する場面:
- 録音し直さず台詞を修正したい。
- 一文だけ素早くローカライズまたは修正したい。
- 新しい発話に指定した声の個性を持たせたい。
生成結果
元動画、音声リファレンス、新しい台本から生成した結果です:
このチュートリアルで分かること
- 1本の自然な元動画を新しい台詞に再利用できます。
- 短い音声サンプルで声の個性を指定できます。
- 元の動きが落ち着いて自然なほど、書き換え結果も自然になります。
再現手順
- Text to Video Lip Syncを開きます。
- 顔が明瞭な自然なトーキング動画を追加します。
- クローン用の短い音声を追加します。
- 新しい台本を貼り付けます。
- 生成し、元の画面で新しい発話が自然に見えるか確認します。



