Đưa cho ClipNova một gương mặt và lời nói: bản ghi âm của chính bạn hoặc một kịch bản gõ sẵn. ClipNova làm gương mặt chuyển động để môi, đầu và biểu cảm theo đúng lời nói. Đã quay video rồi? Đồng bộ khẩu hình video của bạn sang ngôn ngữ khác.
Ba bước đầu diễn ra trong công cụ Avatar AI biết nói, bước thứ tư trong công cụ Dịch video bằng AI. Dưới đây là cùng một người dẫn, từ một bức ảnh tĩnh đến video đã đồng bộ khẩu hình.
Chọn một avatar trong thư viện, tạo chân dung mới từ mô tả hoặc tải ảnh của bạn lên. Gương mặt rõ nét, nhìn thẳng và đủ sáng cho chuyển động miệng tự nhiên nhất.
Tải một đoạn giọng nói lên và gương mặt sẽ nói đúng như vậy, bằng giọng của bạn. Hoặc gõ kịch bản và chọn một giọng ClipNova để đọc. Bạn cũng có thể đặt người đó vào nền mới và chọn khung 16:9, 9:16 hoặc 1:1.
Kling AI Avatar v2 (Base và Pro) hoặc OmniHuman (Ultra) làm ảnh chuyển động theo âm thanh: miệng khớp với từng âm, đầu và gương mặt chuyển động như người đang nói. Lời nói dài được chia thành các đoạn đã đồng bộ khẩu hình rồi ghép lại thành một video.
Tải một video có người nói dài 2 đến 60 giây lên công cụ Dịch video bằng AI. Video được lồng tiếng sang một trong 18 ngôn ngữ bằng chính giọng của người nói, và lipsync-2 vẽ lại miệng trên cảnh quay gốc để khớp với lời mới.
Một bản đồng bộ chỉ cử động hàm sẽ lộ sai chỉ trong một giây. Con người đọc gương mặt: hình dáng môi khi phát âm M hay O, cái gật đầu cuối câu, ánh mắt vẫn nhìn về phía họ. ClipNova dùng các mô hình avatar biết nói để làm cả gương mặt chuyển động theo âm thanh, không chỉ riêng cái miệng.
Bạn chọn cách lời nói được đưa vào. Tải bản ghi âm của chính bạn khi cách diễn đạt quan trọng, hoặc gõ kịch bản và để giọng ClipNova đọc. Dù cách nào, nhịp thời gian đều lấy từ âm thanh, nên môi khớp với từng âm tiết.
Với cảnh quay bạn đã có, công cụ Dịch video bằng AI làm ngược lại: giữ nguyên hình ảnh, lồng tiếng lời nói sang ngôn ngữ khác bằng chính giọng người nói và đồng bộ lại khẩu hình. Không cần quay lại, và video vẫn là video của bạn.
Biến kịch bản sản phẩm thành người dẫn nói trước ống kính ở khung 9:16, sẵn sàng cho Reels và TikTok.
Cho phần thuyết minh của bạn một người dẫn cố định trên màn hình mà không cần tự quay.
Biến kịch bản trung tâm trợ giúp và các bước onboarding thành video ngắn có người nói.
Đồng bộ lại một video có người nói với bản lồng tiếng đã dịch, giữ nguyên giọng của người nói.
Đồng bộ khẩu hình AI làm cho chuyển động miệng của một gương mặt khớp với lời nói. Trong ClipNova, bạn có thể làm một bức ảnh nói theo âm thanh hoặc kịch bản của bạn, hoặc đồng bộ lại một video có người nói theo bản dịch của nội dung đã nói.
Có. Trong công cụ Avatar AI biết nói, chọn hoặc tải một gương mặt lên, rồi tải đoạn giọng nói của bạn thay vì gõ kịch bản. Video sẽ theo bản ghi âm của bạn từng từ một.
Có, sang ngôn ngữ khác. Công cụ Dịch video bằng AI lồng tiếng một video có người nói dài 2 đến 60 giây sang một trong 18 ngôn ngữ bằng chính giọng người nói, rồi đồng bộ khẩu hình trên cảnh quay gốc với lời mới.
Video avatar biết nói dùng Kling AI Avatar v2 ở cấp Base và Pro, và OmniHuman ở Ultra. Dịch video dùng tính năng lồng tiếng của ElevenLabs, sau đó là mô hình lipsync-2.
Một người, gương mặt rõ và hướng về ống kính, ánh sáng đều và sắc nét. Giọng nói sạch, không có nhạc chèn lên, cho khẩu hình chính xác nhất.
Video avatar biết nói có thể tạo ở khung 16:9, 9:16 hoặc 1:1, hoặc theo đúng tỉ lệ của ảnh. Video đã dịch giữ nguyên định dạng của clip bạn tải lên.
Video đồng bộ khẩu hình có trong mọi gói trả phí, từ $19 mỗi tháng, và gói nào cũng có đầy đủ quyền thương mại. Chi phí của mỗi video được hiển thị bằng credit trước khi bạn tạo.
Tham gia cùng các nhà sáng tạo biến ý tưởng thành video khiến người xem dừng lướt, không cần ê-kíp, phần mềm hay thời gian học.