Руководство

Как заставить фотографию говорить под загруженное аудио

FreeLipSync TeamFreeLipSync Team|4 min read
Вымышленный портрет ведущего подкаста из Юго-Восточной Азии, использованный для урока по говорящим фото с загруженным аудио

Чтобы сделать фото-разговор с загруженным аудио, выберите четкий портрет, подготовьте чистую запись в формате MP3 или WAV, загрузите ее в Audio to Talking Photo и сгенерируйте. Используйте этот маршрут, когда голос, темп, паузы и акценты записи уже окончательны.

Что вам нужно

  • Исходное изображение: Источником является вымышленный ведущий подкаста из Юго-Восточной Азии, сфотографированный прямо в чистой студии. Микрофон расположен снизу и сбоку, поэтому он устанавливает контекст, не закрывая рот.
  • Входной звук, используемый в этом примере: Для этой демонстрации был синтезирован формат MP3, но он ведет себя так же, как и любой окончательный вариант закадрового голоса, который вы загружаете. Обрезайте мертвый воздух, удаляйте случайные щелчки и нормализуйте явные скачки громкости перед генерацией; синхронизация губ соответствует предоставленной вами записи.
  • Инструмент: Audio to Talking Photo

Загружайте только те записи и портреты, на использование которых у вас есть разрешение. Не клонируйте и не имитируйте голос человека без разрешения и не раскрывайте синтетические материалы там, где этого требует контекст.

Исходное изображение и входные данные

Вымышленный портрет ведущего подкаста из Юго-Восточной Азии, использованный для урока по говорящим фото с загруженным аудио

Входной звук, используемый в этом примере

Ниже приведён точный текст локализованной демо-аудиозаписи:

Этот ролик точно повторяет загруженную запись, включая её темп и паузы. Используйте этот способ, когда голос уже звучит как нужно и остаётся лишь синхронизировать фотографию.

Необработанный результат

Неотредактированный результат сохраняет ритм и паузы MP3. В этом главное отличие от рабочего процесса, основанного на тексте: исполнение определяется в аудиоредакторе или в сеансе записи до того, как фотография будет анимирована.

Откройте специальную страницу просмотра видео.

Пошаговый рабочий процесс

  1. Подготовьте одно четкое исходное изображение. — Используйте одно изображение, обращенное вперед, с видимым ртом, равномерным освещением, без рук, микрофона или тяжелой тени, закрывающей губы.
  2. Откройте соответствующий инструмент FreeLipSync. — Откройте связанный инструмент для этого рабочего процесса. Убедитесь, что режим ввода соответствует вашему источнику: текст, загруженная речь или аудио песни.
  3. Добавьте сценарий или аудиовход — Добавьте короткий чистый ввод. Сделайте первый тест простым, чтобы можно было легко определить, совпадают ли изображение и звук.
  4. Генерация результата синхронизации губ — Сгенерируйте один необработанный результат, не изменяя одновременно несколько переменных. Контролируемый первый проход значительно ускоряет устранение неполадок.
  5. Просмотрите полный результат перед публикацией — Смотреть со звуком от начала до конца. Проверьте видимость рта, время, произношение и то, честно ли клип представляет источник.

Почему эта установка работает

Загруженный аудиофайл является лучшим источником правды, когда важны произношение, эмоции, время или конкретный утвержденный голос. Короткий обзор также помогает определить, связана ли проблема с записью или изображением.

Контрольный список качества

  • Обрезайте нежелательную тишину и клики перед загрузкой; не ждите, что анимация изображений восстановит запись.
  • Во время первого теста голос должен быть центрированным и разборчивым, фоновая музыка должна быть ограничена.
  • Разместите микрофоны, руки и подписи подальше от видимого рта на исходном изображении.

Распространенные ошибки, которых следует избегать

  • Загружайте только те записи и портреты, на использование которых у вас есть разрешение. Не клонируйте и не имитируйте голос человека без разрешения и не раскрывайте синтетические материалы там, где этого требует контекст.
  • Не начинайте с длинного сценария или песни. Короткий первый проход дает вам более быстрый и качественный сигнал.
  • Не публикуйте лицо, персонаж, запись или песню, если у вас нет необходимого разрешения или лицензии.

Вопросы, которые задают люди

Является ли загруженный звук лучше, чем преобразование текста в речь?

Лучше, когда точное исполнение уже есть. Преобразование текста в речь происходит быстрее, если у вас есть только сценарий и вам удобно выбирать предустановленный голос.

Какой аудиоформат мне следует использовать?

Чистый MP3 или WAV — практичный выбор. Четкость звука и постоянный уровень имеют большее значение, чем использование неоправданно большого файла.

Изменит ли инструмент мои паузы?

Результат соответствует загруженной записи, поэтому перед созданием отредактируйте длинные паузы или нежелательные вдохи, если вы не хотите, чтобы они были в клипе.

Сделайте свою версию

Сначала доработайте короткий голосовой клип, а затем загрузите его с четким портретом на Audio to Talking Photo.

Audio to Talking Photo

Related