SenseAvatar
Genera vídeo de humano digital con sincronía labial desde un retrato y una pista de voz
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
SenseAvatar is a digital-human video capability SenseTime introduced in August 2022 and offers as an interface. Given a portrait and a voice track, it generates a talking digital human whose lip movement matches the speech, with natural head motion. It is used for virtual presenters, announcements and customer service. The capability is a closed service.
Por qué merece la pena recordarlo
It reduced digital-human generation to “one photo plus one voice track”, letting lip-synced avatar videos be produced at scale through an interface — an early example of digital humans moving toward large-scale use.
Especificaciones clave
- Input
- A single portrait and a voice track
- Output
- Lip-synced talking digital-human video
- Availability
- API
- Open weights
- No
Capacidades
Conceptos relacionados
Autoencoders y VAE
Comprime la información por un cuello de botella y deja que vuelva a crecer
Panorama de los modelos generativos
Los modelos discriminativos responden "qué es esto"; los generativos, "cómo debería verse"
Generación multimodal
Un mismo modelo que aprende a hablar, dibujar, moverse e incluso modelar el mundo 3D