Este exemplo de Text to Video Lip Sync começa com um vídeo falado natural. Em vez de enviar a fala final em áudio, clonamos uma voz a partir de uma amostra curta e substituímos a frase com texto.
Vídeo original
Este é o vídeo original usado.
Requisitos do vídeo original
- Um vídeo com fala natural funciona melhor e não precisa conter a frase final.
- De cerca de 5 segundos a alguns minutos é adequado.
- O rosto deve ficar visível na maior parte da cena.
- Movimentos pequenos e naturais ajudam.
- Evite gestos exagerados, giros repentinos ou ações grandes.
Se você gravar um vídeo para esse fluxo, mantenha tudo simples. Dizer “um, dois, três” basta; não é preciso memorizar o roteiro final diante da câmera.
Referência de voz
Esta amostra curta é usada para clonar o estilo de fala:
Entrada de referência de voz
Roteiro substituto
Este é o roteiro em inglês realmente usado na demonstração; ele foi preservado para corresponder ao resultado:
That's it for today! Isn't this incredible? It's free, it's fast, it's u* — and you can even generate lip sync videos up to 60 minutes long.
Este caminho é útil quando:
- Você quer revisar uma frase sem gravar novo áudio.
- Precisa localizar ou corrigir uma frase rapidamente.
- Quer que a nova fala mantenha uma identidade de voz escolhida.
Resultado gerado
Este resultado combina o vídeo original, a referência de voz e o novo roteiro:
O que este tutorial mostra
- Um vídeo natural pode ser reutilizado para uma fala totalmente nova.
- Uma referência curta basta para definir a identidade vocal.
- A reescrita funciona melhor quando o movimento original é calmo e natural.
Como recriar este fluxo
- Abra Text to Video Lip Sync.
- Envie um vídeo falado natural com um rosto claro.
- Envie uma referência curta de voz para clonagem.
- Cole o novo roteiro.
- Gere e confira se a nova fala parece natural na cena original.



