一語ごとに合う口の動き

AIリップシンク

ClipNovaに顔と言葉を渡すだけ。言葉は自分の録音でも、入力した台本でもかまいません。唇、頭、表情が話に合わせて動くよう顔をアニメーション化します。撮影済みの動画なら、別の言語にリップシンクできます。

こんなプラットフォームに最適
信頼するクリエイターは
世界中に
AIリップシンクの画像
仕組み

顔と声を入れると、 話す動画ができあがる。

最初の3ステップはAIトーキングアバターで、4つ目はAI動画翻訳で行います。同じプレゼンターが、1枚の写真からリップシンク動画になるまでを追ってみましょう。

  1. AIリップシンクの画像 — アニメーション化する顔として選ばれた、正面を向いたプレゼンターのポートレート
    — 01 —
    顔

    顔写真から始める

    ライブラリからアバターを選ぶ、説明文から新しいポートレートを生成する、または自分の写真をアップロードします。正面を向き、明るく鮮明に写った顔ほど自然な口の動きになります。

  2. AIリップシンクの画像 — アップロードした音声録音と入力した台本。顔に言葉を与える2つの方法
    — 02 —
    音声

    録音をアップロードするか、台本を入力する

    音声クリップをアップロードすれば、顔はその内容をあなたの声でそのまま話します。台本を入力して、読み上げるClipNovaの音声を選ぶこともできます。人物を新しい背景に置いたり、16:9、9:16、1:1の形式を選んだりも可能です。

  3. AIリップシンクの画像 — 動画プレーヤーの中で話し始めたプレゼンターと、フレーム下の音声波形
    — 03 —
    同期

    唇、頭、表情が話に合わせて動く

    Kling AI Avatar v2(BaseとPro)またはOmniHuman(Ultra)が音声に合わせて写真を動かします。口は一つひとつの音に合い、頭と顔は話している人と同じように動きます。長い音声はリップシンクしたセグメントに分割され、1本の動画につなげられます。

  4. AIリップシンクの画像 — 英語の元動画のフレームと、スペイン語にリップシンクした同じフレームの比較
    — 04 —
    撮影済みなら

    動画を別の言語にリップシンク

    2〜60秒の話している動画をAI動画翻訳にアップロードします。話者本人の声で18言語のいずれかに吹き替えられ、lipsync-2が元の映像の口を描き直して新しい言葉に合わせます。

リアルに見える理由

リップシンクは 口を動かすだけではない。

あごだけを動かすリップシンクは、1秒で不自然だと分かります。人は顔を読み取ります。「M」や「O」を発音するときの唇の形、文の終わりのうなずき、こちらを見つめ続ける目。ClipNovaは口だけでなく顔全体を音声に合わせて動かすトーキングアバターモデルを使っています。

言葉の届け方は自分で選べます。話し方が大事なときは自分の録音をアップロード。台本を入力してClipNovaの音声に読ませることもできます。どちらの場合もタイミングは音声から決まるので、唇はすべての音節にぴったり合います。

撮影済みの映像には、AI動画翻訳がその逆を行います。映像はそのまま、話者本人の声で別の言語に吹き替え、口の動きを合わせ直します。撮り直しは不要で、動画はあなたの動画のままです。

こんな用途に

どんな顔にも、 どんな言葉にも

広告とUGC

撮影なしのスポークスパーソン動画

商品の台本を、9:16でカメラに語りかけるプレゼンター動画に。ReelsやTikTokにそのまま使えます。

クリエイター

顔出しなしチャンネルに顔を

自分を撮影せずに、ナレーションにいつも同じ画面上のホストを付けられます。

研修とサポート

人の顔で伝える解説動画

ヘルプセンターの原稿やオンボーディングの手順を、短い語りかけ動画に変えます。

ローカライズ

同じ動画を新しい言語で

既存の話している動画を、話者の声を保った翻訳吹き替えに合わせてリップシンクし直します。

AIリップシンクに関する よくある質問

AIリップシンクとは何ですか?+

AIリップシンクは、顔の口の動きを音声に合わせる技術です。ClipNovaでは、写真を動かして音声や台本どおりに話させることも、話している動画を発言内容の翻訳に合わせてリップシンクし直すこともできます。

写真を自分の音声にリップシンクできますか?+

はい。AIトーキングアバターで顔を選ぶかアップロードし、台本を入力する代わりに音声クリップをアップロードします。動画はあなたの録音に一語一語ついていきます。

撮影済みの動画をリップシンクできますか?+

はい、別の言語へのリップシンクが可能です。AI動画翻訳は2〜60秒の話している動画を話者本人の声で18言語のいずれかに吹き替え、元の映像の口を新しい言葉に合わせます。

どのモデルを使っていますか?+

トーキングアバター動画は、BaseとProのティアでKling AI Avatar v2、UltraでOmniHumanを使います。動画翻訳はElevenLabsの吹き替えの後にlipsync-2モデルを使います。

元の写真や動画はどんなものが適していますか?+

1人だけが写り、顔が見えていてカメラの方を向き、均一な光で鮮明なもの。音楽が重なっていないクリアな音声ほど、口の形が正確になります。

どの形式で書き出せますか?+

トーキングアバター動画は16:9、9:16、1:1、または写真そのままの比率で作成できます。翻訳した動画はアップロードしたクリップの形式を保ちます。

料金はいくらですか?+

リップシンク動画は月額$19からのすべての有料プランに含まれ、どのプランにも完全な商用利用権が付きます。各動画のコストは生成前にクレジットで表示されます。

今日から作り始めよう

必要なのは 顔と声だけ。

アイデアをスクロールを止める動画に変えるクリエイターに加わろう。チームもソフトも学習も不要。

リップシンク動画を作る