SenseAvatar
Tạo video người kỹ thuật số khớp khẩu hình từ ảnh chân dung và một đoạn âm thanh
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
SenseAvatar is a digital-human video capability SenseTime introduced in August 2022 and offers as an interface. Given a portrait and a voice track, it generates a talking digital human whose lip movement matches the speech, with natural head motion. It is used for virtual presenters, announcements and customer service. The capability is a closed service.
Vì sao đáng ghi nhớ
It reduced digital-human generation to “one photo plus one voice track”, letting lip-synced avatar videos be produced at scale through an interface — an early example of digital humans moving toward large-scale use.
Thông số chính
- Input
- A single portrait and a voice track
- Output
- Lip-synced talking digital-human video
- Availability
- API
- Open weights
- No
Năng lực liên quan
Khái niệm liên quan
Autoencoder và VAE
Nén thông tin qua một nút thắt rồi để nó mọc lại
Tổng quan về mô hình sinh
Mô hình phân biệt trả lời "đây là gì"; mô hình sinh trả lời "nó nên trông như thế nào"
Sinh đa phương thức
Một mô hình học nói, vẽ, chuyển động — thậm chí mô hình hóa thế giới ba chiều