Este ejemplo de Text to Video Lip Sync parte de un clip hablado natural. En vez de subir la frase final como audio, clonamos una voz desde una muestra corta y sustituimos la frase con texto.
Clip original
Este es el video original utilizado.
Requisitos del video original
- Funciona mejor un clip con habla natural; no tiene que contener la frase final.
- Una duración de unos 5 segundos a varios minutos es adecuada.
- El rostro debe permanecer visible durante la mayor parte del plano.
- Los movimientos pequeños y creíbles ayudan.
- Evita gestos exagerados, giros repentinos o grandes acciones.
Si grabas un clip específicamente para este flujo, mantenlo sencillo. Decir «uno, dos, tres» es suficiente: no necesitas memorizar el guion final frente a la cámara.
Referencia de voz
Esta muestra corta se usa para clonar el estilo de voz:
Entrada de referencia de voz
Guion de sustitución
Este es el guion en inglés usado realmente en la demostración; se mantiene sin traducir para corresponder al resultado:
That's it for today! Isn't this incredible? It's free, it's fast, it's u* — and you can even generate lip sync videos up to 60 minutes long.
Este camino es útil cuando:
- Quieres revisar una frase sin grabar audio nuevo.
- Necesitas localizar o corregir una oración rápidamente.
- Quieres que la voz nueva mantenga una identidad elegida.
Resultado generado
Este resultado combina el clip original, la referencia de voz y el guion nuevo:
Abrir la página de reproducción del resultado
Qué demuestra este tutorial
- Un clip natural puede reutilizarse para una frase completamente nueva.
- Una referencia corta basta para definir la identidad vocal.
- La reescritura funciona mejor cuando el movimiento original es calmado y creíble.
Cómo recrear este flujo
- Abre Text to Video Lip Sync.
- Sube un video hablado natural con un rostro claro.
- Sube una referencia de voz corta para clonarla.
- Pega el guion nuevo.
- Genera y comprueba si la frase resulta creíble en el plano original.



