歌っている写真が同期していないように見える場合は、再生成する前に入力を修正します。つまり、口が覆われていない正面向きの画像を使用し、最初のボーカルの前の沈黙をトリミングし、クリアなリード ボーカルの短いセクションを選択し、重いリバーブや競合する声を避けます。 FreeLipSync は、生成後に手動で口のタイミングを追跡する機能を提供しないため、クリーンなソース タイミングが信頼できる制御となります。
必要なもの
- ソース画像: 架空の歌手はカメラに向かい、マイクは意図的に横に置かれています。 これにより、パフォーマンスのコンテキストを維持しながら、横顔の角度と唇を横切る物体という 2 つの一般的な画像の問題が解消されます。
- この例で使用される入力音声: 18秒のオリジナル曲ははっきりと始まり、リードボーカルが1人います。 独自のクリップに長い楽器のイントロ、群衆のボーカル、重なり合うハーモニー、または子音をマスクするビートが含まれている場合は、診断パス用に単純なセクションにトリミングします。
- 道具: Make Photo Sing
一度に 1 つの変数を診断します。 まずオーディオをトリミングし、次に画像をテストし、次に別のボーカルセクションを試します。 すべてを一緒に変更すると、どの修正が機能したかを知ることができなくなります。
ソース画像と入力
この例で使用される入力音声
共有デモ メディアで使用されている正確な英語のトランスクリプトまたは歌詞:
This is my moment, watch me rise, Spotlight shining in my eyes.
I found my voice, I'm breaking free, This is the start of the real me — Here I go, this is my time!
生の結果
生の結果はクリーンな入力ペアのリファレンスであり、すべての曲やポートレートが同じように動作することを保証するものではありません。 まず最初に注目してください。一貫したオフセットは通常、先頭の沈黙を指します。 不安定な動きは、多くの場合、難しいイメージや混み合ったボーカルミックスを示しています。
段階的なワークフロー
- クリアなソース画像を 1 つ用意する — 口が見える正面向きの画像を 1 枚使用し、照明が均一で、手やマイク、唇を覆う大きな影がないようにします。
- 一致する FreeLipSync ツールを開く — このワークフローのリンクされたツールを開きます。 入力モードがソース (テキスト、アップロードされた音声、または歌のオーディオ) と一致していることを確認します。
- スクリプトまたはオーディオ入力を追加する — 短いクリーンな入力を追加します。 画像と音声が適切に一致しているかどうかを簡単に判断できるように、最初のテストは単純にしてください。
- リップシンク結果を生成する — 複数の変数を一度に変更せずに、1 つの生の結果を生成します。 制御された最初のパスにより、トラブルシューティングがはるかに迅速になります。
- 公開する前に完全な結果を確認する — 最初から最後まで音声付きでご覧ください。 口の見え方、タイミング、発音、そしてクリップがソースを忠実に表現しているかどうかをチェックします。
この設定が機能する理由
リップシンクの生成は、目に見える顔のランドマークと聞こえる音声のタイミングに依存しています。 これら 2 つのシグナルをクリーンアップすることは、問題のある同じペアを繰り返し送信したり、後のクロップで不一致を隠そうとしたりするよりも効果的です。
品質チェックリスト
- 最初に歌われる音節の前の無音部分を削除し、再生成する前に修正されたクリップをエクスポートします。
- クリアなリードボーカルを 1 つ選びます。 最初のパスでは、デュエットのオーバーラップ、コーラススタック、極端なエコーを避けてください。
- 大きな口が覆われておらず、唇にマイクが直接当てられていない、正面を向いたポートレートを使用します。
避けるべきよくある間違い
- 一度に 1 つの変数を診断します。 まずオーディオをトリミングし、次に画像をテストし、次に別のボーカルセクションを試します。 すべてを一緒に変更すると、どの修正が機能したかを知ることができなくなります。
- 同じ問題のある画像と音声を繰り返し再送信しないでください。 1 つの入力を修正してエクスポートし、制御された比較を実行します。
- 必要な許可またはライセンスがない限り、顔、キャラクター、録音、または歌を公開しないでください。
人々が尋ねる質問
口が動き始めるのが遅いのはなぜですか?
一般的な原因は、沈黙が続いたり、声が小さく不明瞭になったりすることです。 最初に意図したサウンドがきれいに始まるようにファイルをトリミングし、再生成します。
生成後にリップシンク トラックを手動で移動できますか?
現在の Make Photo Sing ワークフローにはありません。 オーディオのタイミングまたはソース画像を修正し、新しい結果を生成します。
タイミングは合っているのに口の動きが弱いのはなぜでしょうか?
口が小さく、横向きで、影があったり、遮られたりすると、目に見える動きが減少する可能性があります。 同じオーディオを使用して、よりクリアな正面向きのクロップをテストします。
独自のバージョンを作成する
10 ~ 20 秒のクリーンなボーカル セクションを 1 つトリミングし、遮るもののないポートレートと組み合わせて、Make Photo Sing で再生成します。


