SenseAvatar
Создаёт видео цифрового человека с синхронизацией губ из портрета и дорожки голоса
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
SenseAvatar is a digital-human video capability SenseTime introduced in August 2022 and offers as an interface. Given a portrait and a voice track, it generates a talking digital human whose lip movement matches the speech, with natural head motion. It is used for virtual presenters, announcements and customer service. The capability is a closed service.
Почему стоит запомнить
It reduced digital-human generation to “one photo plus one voice track”, letting lip-synced avatar videos be produced at scale through an interface — an early example of digital humans moving toward large-scale use.
Ключевые характеристики
- Input
- A single portrait and a voice track
- Output
- Lip-synced talking digital-human video
- Availability
- API
- Open weights
- No
Возможности
Связанные концепции
Автоэнкодеры и вариационные автоэнкодеры
Сжать информацию через «бутылочное горлышко», а затем восстановить её
Обзор порождающих моделей
Дискриминативные модели отвечают «что это», порождающие — «как это должно выглядеть»
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир