Tutorial

Sprache im Video mit hochgeladenem Audio ersetzen

FreeLipSync TeamFreeLipSync Team|5 Min. Lesezeit
Titelbild zur Anleitung für den Austausch der Videosprache mit hochgeladenem Audio

Um die Sprache in einem Video durch deine fertige Aufnahme zu ersetzen, lade das Quellvideo und die Audiodatei in Audio to Video Lip Sync hoch. FreeLipSync wählt passende Teile der gefilmten Darbietung für die neue Stimme aus. So kann aus wenigen Sekunden Ausgangsmaterial ein deutlich längeres, natürlich wirkendes Sprechvideo entstehen. Auch die Sprache eines bereits langen Videos lässt sich austauschen, während seine Bewegungen und Mimik erhalten bleiben.

Das konkrete Beispiel verbindet ein 5,06 Sekunden langes Quellvideo mit 39,42 Sekunden Audio zu einem 39,44 Sekunden langen Ergebnis.

Warum Sprache mit hochgeladenem Audio ersetzen?

Einmal filmen, viele Beiträge erstellen

Für regelmäßige Produktneuigkeiten, Kurseinführungen oder Mitteilungen jedes Mal Kamera, Licht und Kulisse vorzubereiten, kostet Zeit und Geld. Bewahre stattdessen einen kurzen Clip mit natürlichen, vielseitigen Gesten auf und nimm für jede neue Botschaft nur die Stimme auf. Die Bildbewegung stammt weiterhin aus einer echten Aufnahme. Deshalb kann selbst ein kurzer Quellclip ein längeres Video glaubwürdig und realistisch tragen.

Mehrere Fassungen derselben Botschaft erstellen

Eine Erklärung braucht womöglich andere Formulierungen für verschiedene Zielgruppen oder Sprachen. Prüfe Text und Sprachaufnahme jeder Fassung und verwende dieselbe gefilmte Darbietung erneut. Die Lippensynchronisation passt das sichtbare Sprechen an die bereitgestellte Aufnahme an; eine Übersetzung erstellt sie nicht automatisch.

Sprache in einem vorhandenen langen Video aktualisieren

Auch eine längere Unterrichtseinheit oder Präsentation kann als Quelle dienen. Lade den zu ändernden Abschnitt und eine passende neue Aufnahme hoch. Körperbewegung und Mimik bleiben auf die ursprüngliche Darbietung gestützt. Dieser Fall wird hier nur beschrieben; ein zweites Videobeispiel ist nicht nötig. Wenn die Person auf eine Grafik zeigt oder einen Gegenstand benutzt, sollten die neuen Worte zu dieser sichtbaren Handlung passen. Soll nur ein Abschnitt eines fertigen Schnitts geändert werden, bearbeite ihn separat und setze ihn anschließend wieder ein.

Ein wiederverwendbares Quellvideo wählen

Du kannst eigenes oder zur Bearbeitung freigegebenes Material verwenden, ohne neu zu drehen. Der folgende Außendreh dauert 5,06 Sekunden und liefert die Bewegung und Mimik für das Ergebnis:

Quellvideo und Audio müssen nicht gleich lang sein. Auch eine perfekt frontale Nahaufnahme des Mundes ist nicht erforderlich. Entscheidend sind natürliche Gesten und Gesichtsausdrücke, die zu vielen Texten passen. Anders als beim Max-Bildmodell werden Bewegung und Mimik in diesem Video-Workflow nicht neu erzeugt; die gefilmte Darbietung bleibt erhalten und die Sprache wird synchronisiert. Max erzeugt Bewegung und Ausdruck aus einem Bild neu und benötigt dafür mehr Zeit. Prüfe vor einer Veröffentlichung die Rechte am Material und an der Darstellung der Person.

Ersatzaudio vorbereiten

Höre die endgültige Aufnahme vollständig an und prüfe Wortlaut, Aussprache und Tempo. Die englische Aufnahme im Beispiel dauert 39,42 Sekunden:

39 Sekunden langes Ersatzaudio

Wenn bisher nur ein neues Skript vorliegt, hilft die Anleitung zum Umschreiben eines Sprechvideos mit Text. Für andere Sprachen müssen Übersetzung und Aufnahme vorher geprüft werden.

Video und Audio hochladen

  1. Öffne Audio to Video Lip Sync.
  2. Lade das Video hoch, dessen Bewegung und Mimik erhalten bleiben sollen.
  3. Wähle Upload Audio, lade die fertige Aufnahme hoch und prüfe beide Dateien.
  4. Kontrolliere die angezeigten Optionen und starte die Erstellung.

Der Screenshot zeigt die tatsächlichen Eingaben: einen rund fünf Sekunden langen Quellclip und eine 39 Sekunden lange Audiodatei. Er entstand während der Verarbeitung; das fertige Video folgt unten.

Oberfläche zum Hochladen von Audio: Fünf Sekunden langes Quellvideo + 39 Sekunden langes Ersatzaudio

Ergebnis mit beiden Eingaben vergleichen

Das Ergebnis dauert 39,44 Sekunden, also nahezu so lange wie das Audio und fast achtmal so lange wie das Quellvideo:

Ergebnis auf der eigenen Wiedergabeseite ansehen

Vergleiche Quelle, Aufnahme und fertiges Video. Die Bewegungen und Ausdrücke sollen natürlich bleiben, während Stimme und Mundbewegung der neuen Aufnahme folgen. Für noch längere Beiträge zählt eine vielseitige Darbietung mehr als die bloße Länge des Quellclips.

Häufig gestellte Fragen

Darf das hochgeladene Audio länger sein als das Quellvideo?

Ja. Hier wurden aus 5,06 Sekunden Quellvideo und 39,42 Sekunden Audio 39,44 Sekunden Video. FreeLipSync ordnet der Aufnahme geeignete Teile der Darbietung zu.

Kann ich die Sprache eines bereits langen Videos ersetzen?

Ja. Verwende das lange Video und die neue Aufnahme. Wenn nur ein Teil eines fertigen Schnitts geändert werden soll, bearbeite diesen Abschnitt separat und füge ihn danach wieder ein.

Was macht einen kurzen Clip wiederverwendbar?

Natürliche Gesten und Ausdrücke, die zu verschiedenen Botschaften passen. Weder maximale Länge noch ein vollkommen frontaler Mund sind ausschlaggebend; vermeide Handlungen, die nur zur ursprünglichen Aussage passen.

Wie unterscheidet sich das vom Max-Bildmodell?

Die Videoeingabe übernimmt gefilmte Bewegung und Mimik und synchronisiert die neue Sprache. Max erzeugt Bewegung und Ausdruck aus einem Bild neu und benötigt mehr Zeit.

Zuletzt aktualisiert:

Verwandte Anleitungen