チュートリアル

アップロード音声で写真を話させる方法

FreeLipSync TeamFreeLipSync Team|8 min read
アップロードされた音声トーキング写真チュートリアルに使用された架空の東南アジアのポッドキャスト ホストのポートレート

アップロードされた音声でフォトトークを作成するには、鮮明なポートレートを選択し、クリーンな MP3 または WAV 録音を準備し、両方を Audio to Talking Photo にアップロードして生成します。 録音の音声、ペース、一時停止、強調がすでに最終的な場合は、このルートを使用します。

必要なもの

  • ソース画像: ソースは、清潔なスタジオで真正面から撮影された架空の東南アジアのポッドキャストホストです。 マイクは下と横に配置されているため、口を覆うことなく状況を確立できます。
  • この例で使用される入力音声: MP3 はこのデモンストレーション用に合成されましたが、アップロードした最終的なナレーションと同様に動作します。 生成前にデッドエアをトリミングし、偶発的なクリック音を除去し、明らかな音量の変化を正規化します。 リップシンクは、提供した録音に従います。
  • 道具: Audio to Talking Photo

使用を許可された録音とポートレートのみをアップロードしてください。 許可なく人の声を複製したり模倣したりしないでください。また、状況に応じて合成メディアを公開しないでください。

ソース画像と入力

アップロードされた音声トーキング写真チュートリアルに使用された架空の東南アジアのポッドキャスト ホストのポートレート

この例で使用される入力音声

以下は、このローカライズされたデモ音声で実際に使用した台本です:

この動画は、アップロードした録音のテンポや間まで正確に反映します。音声の演技が完成していて、写真だけを合わせたいときに最適です。

生の結果

未編集の出力では、MP3 のリズムと一時停止が維持されます。 これがテキストファーストのワークフローとの主な違いです。写真がアニメーション化される前に、オーディオ エディターまたは録音セッションでパフォーマンスが決定されます。

専用の動画視聴ページを開く

段階的なワークフロー

  1. クリアなソース画像を 1 つ用意する — 口が見える正面向きの画像を 1 枚使用し、照明が均一で、手やマイク、唇を覆う大きな影がないようにします。
  2. 一致する FreeLipSync ツールを開く — このワークフローのリンクされたツールを開きます。 入力モードがソース (テキスト、アップロードされた音声、または歌のオーディオ) と一致していることを確認します。
  3. スクリプトまたはオーディオ入力を追加する — 短いクリーンな入力を追加します。 画像と音声が適切に一致しているかどうかを簡単に判断できるように、最初のテストは単純にしてください。
  4. リップシンク結果を生成する — 複数の変数を一度に変更せずに、1 つの生の結果を生成します。 制御された最初のパスにより、トラブルシューティングがはるかに迅速になります。
  5. 公開する前に完全な結果を確認する — 最初から最後まで音声付きでご​​覧ください。 口の見え方、タイミング、発音、そしてクリップがソースを忠実に表現しているかどうかをチェックします。

この設定が機能する理由

発音、感情、タイミング、または特定の承認済みの音声が重要な場合、アップロードされた音声のほうがより正確な情報源となります。 また、クリーン テイクを短くすると、問題が録音にあるのか画像にあるのかを特定しやすくなります。

品質チェックリスト

  • アップロード前に不要な沈黙とクリックをトリミングします。 画像アニメーションによって記録が修復されるとは期待しないでください。
  • 最初のテストでは、BGM を制限し、音声を中心に置いて聞き取りやすいようにします。
  • マイク、手、キャプションをソース画像の目に見える口から離して配置します。

避けるべきよくある間違い

  • 使用を許可された録音とポートレートのみをアップロードしてください。 許可なく人の声を複製したり模倣したりしないでください。また、状況に応じて合成メディアを公開しないでください。
  • 長い脚本や歌から始めないでください。 短いファーストパスにより、より高速で有用な品質の信号が得られます。
  • 必要な許可またはライセンスがない限り、顔、キャラクター、録音、または歌を公開しないでください。

人々が尋ねる質問

アップロードされた音声はテキスト読み上げよりも優れていますか?

正確なパフォーマンスがすでに存在する場合の方が優れています。 スクリプトだけがあり、プリセットの音声を選択することに慣れている場合、テキスト読み上げは高速になります。

どのオーディオ形式を使用すればよいですか?

クリーンな MP3 または WAV が実用的な選択です。 不必要に大きなファイルを使用するよりも、オーディオの明瞭さと一貫したレベルの方が重要です。

ツールによって一時停止は変わりますか?

結果はアップロードされた録音に従うため、長いギャップや不要なブレスをクリップに含めたくない場合は、生成前に編集してください。

独自のバージョンを作成する

まず短いボイスクリップを完成させ、それを鮮明なポートレートとともに Audio to Talking Photo にアップロードします。

Audio to Talking Photo

Related