给 ClipNova 一张脸和要说的话:你自己的录音,或一段输入的脚本。它会让这张脸动起来,嘴唇、头部和表情都跟着语音走。视频已经拍好了?把它对口型成另一种语言。
前三步在 AI 会说话的数字人工具中完成,第四步在 AI视频翻译中完成。下面跟着同一位主讲人,从一张静态照片到一段对好口型的视频。
从素材库中选择数字人,根据描述生成新的肖像,或上传你自己的照片。正脸、清晰、光线充足的人脸,嘴部动作最自然。
上传一段语音,这张脸就会用你的声音一字不差地说出来。也可以输入脚本,选一个 ClipNova 声音来朗读。你还可以把人物放到新背景中,并选择 16:9、9:16 或 1:1 画幅。
Kling AI Avatar v2(Base 和 Pro)或 OmniHuman(Ultra)根据音频驱动照片:嘴型对上每个音,头部和面部像真人说话一样自然活动。较长的语音会被拆成多个对好口型的片段,再拼接成一段视频。
把 2 到 60 秒的说话视频上传到 AI视频翻译。它会用说话人自己的声音配音成 18 种语言之一,再由 lipsync-2 在你的原始画面上重绘嘴部,让嘴型与新台词吻合。
只动下巴的对口型,一秒钟就会露馅。人会读脸:发 M 或 O 时的唇形,句末的一个点头,始终注视着观众的眼睛。ClipNova 使用会说话的数字人模型,根据音频驱动整张脸,而不只是嘴巴。
台词怎么来由你决定。表达语气很重要时,就上传自己的录音;或者输入脚本,让 ClipNova 的声音来读。无论哪种方式,节奏都来自音频,嘴唇能对上每一个音节。
对于已有的素材,AI视频翻译反过来工作:保留你的画面,用说话人自己的声音把语音配成另一种语言,再重新对齐嘴型。无需重拍,视频看起来依然是你的视频。
把产品脚本变成 9:16 竖屏、对着镜头讲解的主讲人视频,直接发 Reels 和 TikTok。
不用自己出镜,也能给旁白配上一位固定的出镜主持人。
把帮助中心文稿和新手引导步骤变成简短的口播视频。
把现有的说话视频重新对口型到保留说话人声音的翻译配音上。
AI对口型是让人脸的嘴部动作与一段语音相匹配。在 ClipNova 中,你可以让一张照片动起来说出你的音频或脚本,也可以把说话视频重新对口型到所说内容的译文上。
可以。在 AI 会说话的数字人工具中选择或上传一张脸,然后上传你的语音片段,而不是输入脚本。视频会逐字跟随你的录音。
可以,对成另一种语言。AI视频翻译会用说话人自己的声音,把 2 到 60 秒的说话视频配音成 18 种语言之一,再让原始画面中的嘴型对上新台词。
数字人说话视频在 Base 和 Pro 档位使用 Kling AI Avatar v2,在 Ultra 档位使用 OmniHuman。视频翻译先用 ElevenLabs 配音,再用 lipsync-2 模型对口型。
画面中只有一个人,脸部可见并朝向镜头,光线均匀、画面清晰。没有背景音乐叠加的干净语音,嘴型最准确。
数字人说话视频可以做成 16:9、9:16 或 1:1,也可以沿用照片本身的比例。翻译后的视频保留你上传片段的画幅。
对口型视频包含在所有付费套餐中,每月 $19 起,每个套餐都附带完整的商用权利。每段视频的费用会在生成前以积分显示。