1 つの画像から AI アバターのリップシンクを作成するには、鮮明な正面を向いたポートレートを AI Talking Photo Generator にアップロードし、短いスクリプトを入力し、音声を選択して生成します。 まずは一文で、遮るもののない口から始めましょう。 以下の生の結果は、表示されたプレゼンター画像と 短い日本語のスクリプトから作成されました。
必要なもの
- ソース画像: この例では、承認された FreeLipSync ブランド プレゼンターを使用します。プレミアム スタジオにいる架空の異人種間の白人と白人の女性で、壁にさりげないロゴとブランド ピンが付いています。 風景ソースは、主題の周囲に使用可能なスペースがすでに残っているため、チュートリアルやランディング ページのプレゼンターに適しています。
- この例で使用される入力音声: セリフは意図的に短く、会話的なものになっています。 テキスト読み上げは運転中の音声を作成するため、句読点によって有用な一時停止が制御されます。 最初のテストでは、長い段落、予測不可能に発音される可能性のある略語、またはポートレートと矛盾する音声スタイルを避けてください。
- 道具: AI Talking Photo Generator
あなたが所有するポートレート、またはアニメーション化の許可を得たポートレートを使用します。 アバターが架空の場合、または AI によって生成された場合は、視聴者がそれを本物の広報担当者と間違える可能性がある場合は、そのことを明らかにします。
ソース画像と入力
この例で使用される入力音声
以下は、このローカライズされたデモ音声で実際に使用した台本です:
はっきりした写真が一枚あれば十分です。短い台本と声を選ぶだけで、FreeLipSyncが撮影なしで自然に話すAIアバターを作ります。
生の結果
これは完全な生の結果であり、プレゼンター主導のウォークスルーや手作業での編集ではありません。 長いバージョンを作成するかどうかを決定する前に、1 つの画像と正確な音声によって生成される唇の動きを判断できます。
段階的なワークフロー
- クリアなソース画像を 1 つ用意する — 口が見える正面向きの画像を 1 枚使用し、照明が均一で、手やマイク、唇を覆う大きな影がないようにします。
- 一致する FreeLipSync ツールを開く — このワークフローのリンクされたツールを開きます。 入力モードがソース (テキスト、アップロードされた音声、または歌のオーディオ) と一致していることを確認します。
- スクリプトまたはオーディオ入力を追加する — 短いクリーンな入力を追加します。 画像と音声が適切に一致しているかどうかを簡単に判断できるように、最初のテストは単純にしてください。
- リップシンク結果を生成する — 複数の変数を一度に変更せずに、1 つの生の結果を生成します。 制御された最初のパスにより、トラブルシューティングがはるかに迅速になります。
- 公開する前に完全な結果を確認する — 最初から最後まで音声付きでご覧ください。 口の見え方、タイミング、発音、そしてクリップがソースを忠実に表現しているかどうかをチェックします。
この設定が機能する理由
明確なミディアムショットによりモデルに安定した顔のディテールが与えられ、短い文により難しいトランジションが制限されます。 被写体はカメラの方を向き、唇は遮られず、スタジオの背景は顔と競合しません。
品質チェックリスト
- 両目と口全体が見えるようにしてください。 生成後にのみ収穫します。
- 台本は話し言葉として書き、自然な呼吸のポイントには句読点を使用します。
- 長いプレゼンテーションに時間を費やす前に、短い文を 1 つテストしてください。
避けるべきよくある間違い
- あなたが所有するポートレート、またはアニメーション化の許可を得たポートレートを使用します。 アバターが架空の場合、または AI によって生成された場合は、視聴者がそれを本物の広報担当者と間違える可能性がある場合は、そのことを明らかにします。
- 長い脚本や歌から始めないでください。 短いファーストパスにより、より高速で有用な品質の信号が得られます。
- 必要な許可またはライセンスがない限り、顔、キャラクター、録音、または歌を公開しないでください。
人々が尋ねる質問
本当に 1 枚の写真で話すアバターを作成できるのでしょうか?
はい。 このワークフローでは、鮮明な 1 枚のポートレートで十分です。 音声が口の動きを動かし、画像がアイデンティティとフレーミングを提供します。
ソースはプロの顔写真である必要がありますか?
いいえ。顔が鮮明で正面を向いており、均一に照明が当たっており、髪、手、マイクで覆われていない場合は、携帯電話の写真が機能します。
テキストまたはアップロードされた音声を使用する必要がありますか?
高速なテキスト読み上げが必要な場合は、テキストを使用します。 Audio to Talking Photo は、最終的なパフォーマンス、ペーシング、または音声録音がすでにある場合に使用します。
独自のバージョンを作成する
AI Talking Photo Generator を開き、上記のチェックリストを再利用し、スクリプトを展開する前に短いプルーフ クリップを作成します。


