教程

如何用一张照片和一段歌曲让照片唱歌

FreeLipSync TeamFreeLipSync Team|7 min read
排练室里的独立歌手肖像,头部侧转约三十度,嘴和下巴没有遮挡。

完整视频教程

如何用一张照片和一段歌曲让照片唱歌 — 完整过程

一张人物肖像加一段十几秒的歌声,就能做出一条会唱歌的视频。这一页放了用到的照片、音频、歌词、生成界面,以及没有做任何处理的成片。 整个过程都在视频里,从素材到成片。

0:00 / 1:32
如何用一张照片和一段歌曲让照片唱歌 — 完整过程

让照片唱歌只需要两个文件:一张人物肖像和一段人声音频,传进照片唱歌工具生成一次就有了。下面这条视频用到的所有素材都在这一页——照片、歌曲、生成前的界面,以及模型吐出来的原始文件。

这首歌是专门为这篇写的原创小样,不是商用曲库里的歌,所以可以完整放出来。

完整过程视频

单独打开这个视频

这个例子用到的素材

  • 照片: 半身肖像,自然的四分之三侧脸,不是证件照式的正面。
  • 歌曲: 一段人声清楚、伴奏不厚的原创录音。
  • 成片: 完整的一条,没做任何处理,音频还是上传的那段。
  • 生成前的界面: 点生成之前工具长什么样。

这张照片

排练室里的独立歌手肖像,头部侧转约三十度,嘴和下巴没有遮挡。

脸大约侧转三十度,光线偏暖也不均匀,更接近大多数人手机相册里真实存在的照片,而不是影楼棚拍。真正要紧的只有一点:嘴和下颌没有被挡住。

歌曲和歌词

上传的歌曲

这段音频的人声压在伴奏之上。口型跟得准不准,这一点的影响比图片分辨率大得多。

歌词

灯光亮起来,节拍正精彩
一张照片也能唱出期待
旋律轻轻来,梦想正盛开
跟着这一刻,一起唱起来

没有剪辑的成片

先完整看一遍再下判断。对口型视频截成单帧看,几乎总是比动起来难看。

单独打开这段成片

让照片唱歌的完整步骤

生成前的界面,照片和歌曲都已经放好。
  1. 挑照片 — 一张图、一张脸,嘴和下巴不被遮住。四分之三侧脸没问题,手、杯子、话筒横在嘴前不行。
  2. 打开照片唱歌工具 — 工具页已经固定成图片加音频、歌唱模型,不用再设置什么。
  3. 放进歌曲 — 用你自己拥有或已获授权的音频。十到二十秒、包含完整一两句就够看了。
  4. 先生成一版 — 确认图片和音频都是对的,生成一次,先把原始文件存下来再去剪。
  5. 完整看一遍 — 整条看完——时序、长音,还有结尾时那张脸是不是还是开头那个人。

成片要重点看哪里

重点听辅音、长元音,还有句子之间的停顿。真人肖像最容易露馅的是停顿:如果人声已经停了嘴还在动,说明模型跟的是伴奏而不是人声。

结果不对时怎么调

  • 某一句嘴型飘?照片不动,把音频裁到那一句单独重生成。
  • 整体时序都发虚?基本都是混音问题,先换一版人声更靠前的音频,再动别的。
  • 脸抖、越到后面越不像?把裁切放宽一点。多给模型一些头颈范围,比换更高分辨率的图有用。

花多少钱

测试不花钱:20 秒的生成不消耗 Pro Video,登录一个免费账号就能下载无水印的低分辨率版本。再往上是按成片计费而不是按秒——一条原画质成片消耗一个 Pro Video。Starter 每 30 天含 20 个 Pro Video,Pro 订阅期内不限量,单次购买的 Creator Pack 另加 5 个永不过期的 Pro Video。

看看各档套餐的价格

常见问题

脸一定要正对镜头吗?

不用。四分之三侧脸完全可以,通常还比正面更自然。关键是嘴唇和下颌看得见、没被挡住。

第一版做多长合适?

十到二十秒。够放下完整一句加一次换气,又不至于为了发现混音有问题多花钱。

歌一定要和页面语言一致吗?

不用。口型跟的是音频文件,不是页面语言。这里用中文歌只是为了演示读起来顺。

可以用别人的照片吗?

要先取得本人同意,或有其他合法依据。具体要求各国不同,也取决于你要发到哪里;无论如何,平台收到投诉一般都会下架。

可以直接用商业歌曲吗?

除非你拥有版权,或已经拿到发布渠道对应的授权。原创、定制、免版税或平台已授权的音频最省事。

换成你自己的照片

把你自己的肖像放进照片唱歌工具,配一段有版权的歌,先生成一版再考虑做长的。

打开照片唱歌工具

Related