Этот пример Text to Video Lip Sync начинается с естественного говорящего видео. Вместо готового аудио мы клонируем голос по короткому образцу и заменяем реплику текстом.
Исходное видео
Это исходное видео для руководства.
Требования к исходному видео
- Лучше всего подходит естественная речь; исходник не обязан содержать финальную реплику.
- Подойдёт длительность примерно от 5 секунд до нескольких минут.
- Лицо должно быть видно большую часть кадра.
- Небольшие естественные движения полезны.
- Избегайте преувеличенных жестов, резких поворотов и крупных действий.
Если вы снимаете специально для этого процесса, говорите просто и естественно. Достаточно произнести «один, два, три» — учить финальный текст перед камерой не нужно.
Образец голоса
Этот короткий образец используется для клонирования манеры речи:
Входной образец голоса
Новый сценарий
Ниже приведён английский сценарий, фактически использованный в демонстрации; он сохранён без перевода для соответствия результату:
That's it for today! Isn't this incredible? It's free, it's fast, it's u* — and you can even generate lip sync videos up to 60 minutes long.
Этот способ подходит, если:
- Нужно изменить реплику без новой записи.
- Нужно быстро локализовать или исправить одно предложение.
- Нужно сохранить выбранную голосовую идентичность.
Готовый результат
Результат создан из исходного видео, образца голоса и нового сценария:
Открыть отдельную страницу результата
Что показывает руководство
- Естественный исходный клип можно использовать для совершенно новой реплики.
- Короткого образца достаточно для голосовой идентичности.
- Спокойные и правдоподобные движения улучшают результат.
Как повторить процесс
- Откройте Text to Video Lip Sync.
- Загрузите естественное говорящее видео с чётким лицом.
- Загрузите короткий образец для клонирования голоса.
- Вставьте новый сценарий.
- Создайте результат и проверьте, естественно ли выглядит новая реплика.



