Tutoriel

Remplacer la parole dans une vidéo avec un audio importé

FreeLipSync TeamFreeLipSync Team|5 min de lecture
Couverture du tutoriel de remplacement de la parole avec un audio importé

Pour remplacer les paroles d’une vidéo par votre propre enregistrement, importez la vidéo source et l’audio final dans Audio to Video Lip Sync. FreeLipSync sélectionne les passages adaptés de la performance filmée pour suivre la nouvelle voix. Quelques secondes de source peuvent ainsi produire une vidéo parlée bien plus longue, naturelle et réaliste. Vous pouvez aussi partir d’une vidéo déjà longue et modifier sa voix tout en conservant ses gestes et expressions.

L’exemple associe une source de 5,06 secondes, un audio de 39,42 secondes et un résultat de 39,44 secondes.

Pourquoi remplacer la parole avec un audio importé ?

Filmer une fois, produire plusieurs prises de parole

Une personne qui présente des cours, des annonces produit ou des nouvelles régulières n’a pas besoin de remettre en place caméra, lumière et décor pour chaque texte. Conservez un court plan aux gestes naturels, utilisable pour plusieurs messages, puis enregistrez seulement la nouvelle voix. Cela réduit le temps et le coût de production. Puisque les mouvements et les expressions viennent d’une vraie prise de vue, une source brève peut soutenir un résultat plus long qui paraît authentique.

Créer plusieurs versions d’un même message

Une explication peut changer selon le public, la campagne ou la langue. Préparez et vérifiez chaque texte et chaque enregistrement, puis réutilisez la même vidéo source. La synchronisation labiale adapte la parole visible à l’audio fourni ; elle ne traduit pas les mots à votre place.

Mettre à jour la parole d’une vidéo existante plus longue

Une leçon ou une présentation déjà enregistrée peut également servir de source. Importez la séquence à modifier et le nouvel audio correspondant : les mouvements et les expressions d’origine restent la base de l’image. Ce cas est décrit ici sans deuxième démonstration filmée. Si la personne pointe un graphique ou manipule un objet, veillez à ce que le nouveau texte corresponde à ces actions. Pour ne changer qu’une partie d’un montage, isolez-la d’abord, puis réintégrez-la après traitement.

Choisir une vidéo source réutilisable

Vous pouvez utiliser une vidéo que vous possédez ou êtes autorisé à modifier, sans tourner de nouveau plan. La séquence extérieure suivante dure 5,06 secondes et fournit les gestes et expressions du résultat :

La source n’a pas besoin d’avoir la même durée que l’audio ni de montrer la bouche parfaitement de face. Choisissez plutôt des mouvements naturels et des expressions compatibles avec des phrases variées. Ce flux vidéo conserve la performance filmée et synchronise la nouvelle parole ; le modèle Max pour images recrée mouvements et expressions à partir d’une photo et prend plus de temps. Vérifiez les droits sur les images et la représentation de la personne avant publication.

Préparer l’audio de remplacement

Écoutez l’enregistrement final pour vérifier les mots, la prononciation et le rythme. L’audio anglais de cet exemple dure 39,42 secondes :

Audio de remplacement de 39 secondes

Si vous n’avez encore qu’un script, consultez le tutoriel de réécriture d’une vidéo parlée avec du texte. Pour une autre langue, validez d’abord la traduction et la prise de voix.

Importer la vidéo et l’audio

  1. Ouvrez Audio to Video Lip Sync.
  2. Importez la vidéo dont vous voulez conserver les mouvements et expressions.
  3. Choisissez Upload Audio, importez l’enregistrement final et vérifiez les deux fichiers.
  4. Examinez les options proposées et lancez la génération.

La capture montre les entrées réellement utilisées : une source d’environ cinq secondes et un audio de 39 secondes. Elle a été prise pendant le traitement ; le résultat terminé apparaît ci-dessous.

Interface d’importation audio: Vidéo source de cinq secondes + Audio de remplacement de 39 secondes

Comparer le résultat aux deux entrées

La vidéo finale dure 39,44 secondes, presque autant que l’audio et près de huit fois plus que la source :

Voir le résultat sur sa page de lecture

Comparez la source, l’enregistrement et la vidéo créée. Les gestes et expressions doivent garder le naturel de la prise d’origine, tandis que la voix et les lèvres suivent le nouvel audio. Pour un message encore plus long, privilégiez une performance courte mais polyvalente plutôt qu’une longue prise peu réutilisable.

Questions fréquentes

L’audio importé peut-il être plus long que la vidéo source ?

Oui. Dans cet exemple, une source de 5,06 secondes et un audio de 39,42 secondes produisent une vidéo de 39,44 secondes. FreeLipSync choisit les passages adaptés de la performance initiale.

Peut-on remplacer la parole d’une vidéo déjà longue ?

Oui. Importez la vidéo longue et le nouvel enregistrement. Si vous ne modifiez qu’une séquence d’un montage, traitez-la séparément puis replacez-la dans la version complète.

Qu’est-ce qui rend un court plan réutilisable ?

Des gestes naturels et des expressions capables d’accompagner plusieurs messages. Sa longueur et une bouche parfaitement face caméra comptent moins qu’une performance indépendante d’une phrase précise.

Quelle différence avec le modèle Max pour images ?

L’entrée vidéo reprend les mouvements et expressions déjà filmés et synchronise la nouvelle voix. Max les génère à partir d’une image, ce qui demande plus de temps.

Dernière mise à jour:

Tutoriels associés