SenseAvatar
Gera vídeo de humano digital com sincronia labial a partir de um retrato e uma faixa de voz
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
SenseAvatar is a digital-human video capability SenseTime introduced in August 2022 and offers as an interface. Given a portrait and a voice track, it generates a talking digital human whose lip movement matches the speech, with natural head motion. It is used for virtual presenters, announcements and customer service. The capability is a closed service.
Por que vale a pena lembrar
It reduced digital-human generation to “one photo plus one voice track”, letting lip-synced avatar videos be produced at scale through an interface — an early example of digital humans moving toward large-scale use.
Especificações-chave
- Input
- A single portrait and a voice track
- Output
- Lip-synced talking digital-human video
- Availability
- API
- Open weights
- No
Capacidades
Conceitos relacionados
Autoencoders e VAE
Comprima a informação por um gargalo e deixe-a crescer de volta
Visão geral dos modelos generativos
Modelos discriminativos respondem "o que é isto"; generativos, "como deveria parecer"
Geração multimodal
Um único modelo que aprende a falar, desenhar, mover-se e até modelar o mundo 3D