ElevenLabs
Un servicio multilingüe de texto a voz con voces naturales y clonables
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
ElevenLabs is a text-to-speech service the company launched in 2022 and offers through an API. It synthesises text into natural speech, supports multiple languages and voice cloning, and provides a low-latency streaming mode. Its multilingual model supports about 29 languages, and voice cloning lets users reproduce a specific timbre from a small number of samples. The service is provided in closed form.
Por qué merece la pena recordarlo
It packaged near-human, timbre-controllable and cloneable speech synthesis into an easy interface, becoming one of the most widely called services for voice-cloning and dubbing applications.
Especificaciones clave
- Languages
- About 29 (multilingual model)
- Abilities
- Speech synthesis and voice cloning
- Low-latency mode
- Streaming synthesis
- Open weights
- No
Capacidades
Conceptos relacionados
Panorama de los modelos generativos
Los modelos discriminativos responden "qué es esto"; los generativos, "cómo debería verse"
Autoencoders y VAE
Comprime la información por un cuello de botella y deja que vuelva a crecer
Mecanismo de atención
Cada posición puede mirar directamente a todas las demás y repartir su atención según la relevancia
Productos similares
SparkTTS
2023Una interfaz de texto a voz orientada al uso en chino
Whisper
2022Transcribe voz en varios idiomas y la traduce al inglés
Lyria
2023Genera música instrumental y vocal a partir de indicaciones de texto
Suno
2023Genera canciones completas con voz a partir de una sola descripción