Tutorial

Ein Sprechvideo mit einem neuen Skript umschreiben

FreeLipSync TeamFreeLipSync Team|5 Min. Lesezeit
Tutorial-Cover mit Ausgangsvideo, geklonter Stimme und neuem Skript

Wenn du die Worte in einem Sprechvideo ändern möchtest, ohne erneut aufzunehmen, öffne Text to Video Lip Sync, lade das vorhandene Video hoch, schreibe das neue Skript und wähle eine Stimme. Das Tool erzeugt die Sprache aus dem Text und synchronisiert sie mit der gefilmten Darstellung. Hier erfährst du, für welche Aufgaben sich das eignet und wie du die Eingaben vorbereitest.

Warum ein Sprechvideo mit Text umschreiben?

Eine Aussage ohne neuen Dreh korrigieren

Nach dem Dreh einer Produkteinführung können sich Preis, Datum, Funktionsname oder Handlungsaufforderung ändern. Für wenige neue Worte Kamera, Licht und Aufnahmeort erneut einzurichten, kostet Zeit. Mit einem Textskript kannst du den Satz korrigieren und die vorhandenen Aufnahmen verwenden.

Soll nur eine Passage eines längeren Films geändert werden, exportiere diese als eigenen Clip und füge das neue Ergebnis später in den Schnitt ein. Das Tool ersetzt nicht automatisch einen einzelnen Satz in einer fertigen Timeline. Eine Geste auf den alten Preis bleibt im Bild sichtbar.

Mehrere Versionen aus einer echten Aufnahme erstellen

Lehrende, Kreative oder Sprecher brauchen oft unterschiedliche Einstiege für Kurse, Kampagnen oder regelmäßige Updates. Ein Clip mit natürlichen, allgemein passenden Bewegungen lässt sich für verschiedene Skripte nutzen. So bleibt die gefilmte Präsenz erhalten, ohne jede Variante neu zu drehen.

Der Textmodus passt, wenn das Skript feststeht, aber noch keine endgültige Sprachaufnahme vorliegt. Wähle eine Preset-Stimme oder klone mit Erlaubnis eine Stimme. Ist der fertige Audiotake bereits vorhanden, nutze die Anleitung mit hochgeladenem Audio.

Eine andere Sprachversion vorbereiten

Du kannst auch eine geprüfte Übersetzung und eine passende Stimme verwenden. Prüfe Bedeutung, Namen, Zahlen und Tonfall vor der Eingabe: Lip-Sync übersetzt die ursprüngliche Sprache nicht selbst. Mehr dazu in Anleitung zum KI-Videodubbing.

Ein Ausgangsvideo für verschiedene Sätze wählen

Das Ausgangsvideo liefert Bewegung, Mimik und Bildausschnitt; es muss den neuen Satz nicht enthalten. Unser Beispiel verwendet einen 5,06 Sekunden langen Clip und zeigt ein ungefähr 10 Sekunden langes Ergebnis aus Text und Stimme. Derselbe Clip erscheint in der Audio-Anleitung, sodass beide Wege vergleichbar sind.

Verwende Material, das du bearbeiten darfst. Die Aufnahme muss weder besonders lang noch durchgehend frontal mit deutlich sichtbarem Mund sein. Entscheidend sind glaubhafte Gesten und Ausdrücke, die zu mehreren Aussagen passen. Dieser Videoweg kann auch Aufnahmen mit kurzen Kopfbewegungen verarbeiten, die für herkömmliche Lip-Sync-Verfahren schwierig sind.

Alltägliche Haltungswechsel sind vielseitig. Ein Zeigen auf ein bestimmtes Produkt oder Zählen mit den Fingern passt dagegen womöglich nur zum ursprünglichen Satz. Der Videoweg behält Körperbewegung und Mimik bei und passt die sichtbare Sprache an; er erzeugt keine neue körperliche Darstellung. Für neu erzeugte Bewegung aus einem Bild gibt es das langsamere Max-Bildmodell.

Neuen Satz schreiben und Stimme auswählen

Prüfe vor dem Generieren Daten, Beträge, Namen und Aussprache. Im Textmodus kannst du eine Preset-Stimme wählen oder eine kurze, autorisierte Aufnahme hochladen beziehungsweise aufnehmen, um die Stimme zu klonen. Die Probe bestimmt den Stimmklang; sie ist nicht der endgültige gesprochene Satz. Hier ist die etwa 16 Sekunden lange englische Referenz aus dem Beispiel:

Stimmreferenz

Ein möglicher neuer Satz wäre: „Der Workshop beginnt jetzt am Freitag um zehn Uhr.“ Das illustriert die Texteingabe und ist kein Transkript des älteren Demovideos.

Ergebnis erzeugen und kontrollieren

Öffne Text to Video Lip Sync, lade das Ausgangsvideo hoch, wähle die Stimme und füge den neuen Satz ein. Vergleiche danach die gesprochenen Worte mit dem freigegebenen Skript und prüfe, ob Mimik und Gestik noch zum Inhalt passen.

Das vorhandene Kurzbeispiel zeigt den Weg mit Text und Stimmreferenz. Es ist weder ein Langvideo noch eine vollständige Bildschirmaufzeichnung des Ablaufs.

Eigene Wiedergabeseite des Ergebnisses öffnen

Ausgangsclip und Ergebnis müssen nicht gleich lang sein. Bei längeren Skripten achte besonders auf auffällige wiederverwendete Gesten. Einen separat geprüften Längenvergleich findest du im Beispiel mit fünf Sekunden Quelle und 39 Sekunden Ergebnis.

Häufige Fragen

Muss ich den neuen Satz im Ausgangsvideo sagen?

Nein. Das Video liefert gefilmte Bewegung und Mimik. Gib die neuen Worte getrennt ein und wähle eine Stimme für die erzeugte Sprache.

Muss ich eine Stimme klonen?

Nein. Das Beispiel verwendet eine Stimmreferenz, aber Preset-Stimmen sind ebenfalls verfügbar. Klone nur Stimmen mit entsprechender Erlaubnis.

Wann sollte ich Audio statt Text hochladen?

Nutze Text, wenn das Skript fertig ist, aber noch kein endgültiger Sprach-Take vorliegt. Wenn du eine fertige Aufnahme mit ihrer Betonung und ihrem Timing behalten willst, wähle den Audio-Weg.

Kann ich denselben Clip für mehrere Skripte nutzen?

Ja. Natürliche, allgemein passende Bewegung macht einen Clip vielseitig. Prüfe jede Variante darauf, ob die sichtbaren Handlungen zur neuen Aussage passen.

Zuletzt aktualisiert:

Verwandte Anleitungen