嘴型逐字对齐

AI对口型

给 ClipNova 一张脸和要说的话:你自己的录音,或一段输入的脚本。它会让这张脸动起来,嘴唇、头部和表情都跟着语音走。视频已经拍好了?把它对口型成另一种语言。

适用于
深受创作者信赖
遍布全球
AI对口型图片
工作原理

输入一张脸和一段声音, 输出一段会说话的视频。

前三步在 AI 会说话的数字人工具中完成,第四步在 AI视频翻译中完成。下面跟着同一位主讲人,从一张静态照片到一段对好口型的视频。

  1. AI对口型图片 — 被选作动画人脸的主讲人正面肖像
    — 01 —
    人脸

    从一张人脸照片开始

    从素材库中选择数字人,根据描述生成新的肖像,或上传你自己的照片。正脸、清晰、光线充足的人脸,嘴部动作最自然。

  2. AI对口型图片 — 一段上传的语音录音和一段输入的脚本,为人脸提供台词的两种方式
    — 02 —
    音频

    上传录音,或输入脚本

    上传一段语音,这张脸就会用你的声音一字不差地说出来。也可以输入脚本,选一个 ClipNova 声音来朗读。你还可以把人物放到新背景中,并选择 16:9、9:16 或 1:1 画幅。

  3. AI对口型图片 — 主讲人已在视频播放器中开口说话,画面下方是语音波形
    — 03 —
    同步

    嘴唇、头部和表情跟着语音走

    Kling AI Avatar v2(Base 和 Pro)或 OmniHuman(Ultra)根据音频驱动照片:嘴型对上每个音,头部和面部像真人说话一样自然活动。较长的语音会被拆成多个对好口型的片段,再拼接成一段视频。

  4. AI对口型图片 — 英文原视频画面与同一画面对口型成西班牙语后的对比
    — 04 —
    已经拍好了?

    把视频对口型成另一种语言

    把 2 到 60 秒的说话视频上传到 AI视频翻译。它会用说话人自己的声音配音成 18 种语言之一,再由 lipsync-2 在你的原始画面上重绘嘴部,让嘴型与新台词吻合。

为什么看起来真实

对口型不只是 动动嘴。

只动下巴的对口型,一秒钟就会露馅。人会读脸:发 M 或 O 时的唇形,句末的一个点头,始终注视着观众的眼睛。ClipNova 使用会说话的数字人模型,根据音频驱动整张脸,而不只是嘴巴。

台词怎么来由你决定。表达语气很重要时,就上传自己的录音;或者输入脚本,让 ClipNova 的声音来读。无论哪种方式,节奏都来自音频,嘴唇能对上每一个音节。

对于已有的素材,AI视频翻译反过来工作:保留你的画面,用说话人自己的声音把语音配成另一种语言,再重新对齐嘴型。无需重拍,视频看起来依然是你的视频。

适用于

任何一张脸, 任何一段话

广告与 UGC

无需拍摄的代言人视频

把产品脚本变成 9:16 竖屏、对着镜头讲解的主讲人视频,直接发 Reels 和 TikTok。

创作者

给不露脸频道一张脸

不用自己出镜,也能给旁白配上一位固定的出镜主持人。

培训与客服

有真人面孔的讲解视频

把帮助中心文稿和新手引导步骤变成简短的口播视频。

本地化

同一段视频,换一种语言

把现有的说话视频重新对口型到保留说话人声音的翻译配音上。

AI对口型 常见问题

什么是 AI对口型?+

AI对口型是让人脸的嘴部动作与一段语音相匹配。在 ClipNova 中,你可以让一张照片动起来说出你的音频或脚本,也可以把说话视频重新对口型到所说内容的译文上。

可以用我自己的音频给照片对口型吗?+

可以。在 AI 会说话的数字人工具中选择或上传一张脸,然后上传你的语音片段,而不是输入脚本。视频会逐字跟随你的录音。

可以给已经拍好的视频对口型吗?+

可以,对成另一种语言。AI视频翻译会用说话人自己的声音,把 2 到 60 秒的说话视频配音成 18 种语言之一,再让原始画面中的嘴型对上新台词。

使用了哪些模型?+

数字人说话视频在 Base 和 Pro 档位使用 Kling AI Avatar v2,在 Ultra 档位使用 OmniHuman。视频翻译先用 ElevenLabs 配音,再用 lipsync-2 模型对口型。

什么样的源照片或视频效果最好?+

画面中只有一个人,脸部可见并朝向镜头,光线均匀、画面清晰。没有背景音乐叠加的干净语音,嘴型最准确。

可以导出哪些画幅?+

数字人说话视频可以做成 16:9、9:16 或 1:1,也可以沿用照片本身的比例。翻译后的视频保留你上传片段的画幅。

费用是多少?+

对口型视频包含在所有付费套餐中,每月 $19 起,每个套餐都附带完整的商用权利。每段视频的费用会在生成前以积分显示。

今天就开始创作

一张脸,一个声音, 就够了。

加入把想法变成让人停下滑动的视频的创作者行列,无需团队、无需软件、无需学习成本。

制作对口型视频