上传宠物照片,再输入台词或添加音频,AI 口型同步生成会说话的猫狗视频。 支持两条完整流程:输入文字并选择预置或获授权的克隆声音,或者上传/现场录制音频。输出是无水印口型同步视频;免费版支持 133 个文本码点或 20 秒音频。
你需要什么
- 源素材: 选择一只正面的狗或猫,眼睛和口鼻清楚、光线均匀,玩具或舌头不要遮住嘴部。
- 语音输入: 输入台词并选择/克隆声音,或切换到音频,上传或录制已有表演。免费文字支持 133 字符,免费音频支持 20 秒。
- 只使用你有权使用的素材与声音。: 只上传你拥有或已获授权使用的人脸、声音、音乐和脚本。
实际源素材与输入
Hello, human. I reviewed the household schedule, and I have one important update: snack time should happen twice, followed by a very long walk.
未经剪辑的结果
上传宠物照片,再输入台词或添加音频,AI 口型同步生成会说话的猫狗视频。 支持两条完整流程:输入文字并选择预置或获授权的克隆声音,或者上传/现场录制音频。输出是无水印口型同步视频;免费版支持 133 个文本码点或 20 秒音频。
如何让宠物开口说话
- 上传宠物照片 — 支持 JPG、PNG、WebP,宠物的脸需清晰可见且大致正对镜头——眼睛和嘴部轮廓可辨认。
- 选择文字或音频 — 输入台词并选择/克隆声音,或切换到音频,上传或录制已有表演。免费文字支持 133 字符,免费音频支持 20 秒。
- 定好宠物人设 — 文字模式可试听俏皮、戏精或一本正经的声音;音频模式则使用表演风格已经到位的清晰录音。
- 生成并分享 — 引擎让嘴型跟随台词,输出无水印短片,可在浏览器预览,登录后下载。
文字模式与音频模式
只要宠物的脸清晰可辨就能用——正面照、眼睛和嘴部轮廓分明的照片同步效果最好。扁脸或毛特别多的宠物效果差异较大;生成是免费的,建议先拿一张照片试试。
更容易获得好结果的输入
- 从清晰人脸开始: 选择一只正面的狗或猫,眼睛和口鼻清楚、光线均匀,玩具或舌头不要遮住嘴部。
- 使用干净语音: 减少音乐、回声、爆音和含混的长停顿,让表演与目标表情一致。
- 先测试短句: 受控短句更容易发现时序、闭口音和源素材问题,再决定是否生成长片段。
限制与不支持的情况
- 大侧脸、长毛遮住口鼻、持续张嘴喘气或画面中有多只动物都会降低稳定性。
- 生成器只改变可见的说话动作,不会自动翻译、核查事实、添加字幕或编辑周围场景。
- 发布前仍需人工检查,尤其是涉及身份、语言或敏感语境时。
按结果计费,不按分钟计费
免费生成不扣 Pro Video,输出无水印,但仍受免费登录与分辨率规则约束。Starter 每个高清结果使用 1 个 Pro Video,不按秒或分钟扣积分;有效 Pro 订阅包含不限量 Pro Video 生成权益。
《2026 AI 视频价格报告》按 20 个 Starter 结果平均每个 1 分钟计算,有效成本约为每分钟 0.25 美元。这是用于市场比较的换算,不是 FreeLipSync 的计费单位。
版权、同意与披露
- 只使用你有权发布的宠物图片,不要把虚构台词包装成兽医或安全建议。
- 只上传你拥有或已获授权使用的人脸、声音、音乐和脚本。
- 当观众可能误认为内容真实时,应清楚标注为合成或经过修改的媒体。
常见问题
宠物说话应用免费吗?
免费。无需账号即可从文字或音频生成宠物说话视频,输出无水印。免费文字上限 133 字符,免费音频上限 20 秒;下载需免费登录,为低分辨率版本,可用 1 个 Pro Video 解锁原分辨率。
狗和猫的脸都能用吗?
只要宠物的脸清晰可辨就能用——正面照、眼睛和嘴部轮廓分明的照片同步效果最好。扁脸或毛特别多的宠物效果差异较大;生成是免费的,建议先拿一张照片试试。
怎么给宠物选声音?
在预置声音库中试听,直到找到符合人设的声音,或用一小段录音克隆。俏皮的高音和过分严肃的低音是两种经典喜剧选择。
台词或音频最长能有多少?
文字:免费版 133 字符、Starter 800 字符、Pro 16,000 字符。上传或录制音频:免费版 20 秒、Starter 3 分钟、Pro 60 分钟。


