Синтез речи
Озвучить текст естественным голосом
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ
Takes text and outputs audio that reads it aloud. It must handle both pronunciation — saying the right words — and prosody — where to pause and what to stress — while carrying a target speaker timbre. It runs opposite to speech recognition, and unlike voice cloning it does not need to imitate a specific person from a few samples but usually picks from preset voices.
Как это устроено
Modern systems are mostly two-stage: an acoustic model predicts an intermediate representation such as a mel spectrogram from text, then a vocoder restores the waveform; both can be trained end to end. Discrete audio tokens with autoregressive or diffusion decoding yield more natural prosody and support zero-shot timbre imitation. On the text side, phonemisation and text normalisation handle digits, abbreviations and polyphonic characters.
Примеры продуктов
6ElevenLabs
2022Многоязычный сервис синтеза речи с естественными и клонируемыми голосами
SparkTTS
2023Интерфейс синтеза речи, ориентированный на китайский язык
Synthesia
2019Введите текст — получите видео с говорящим цифровым аватаром
Gemini
2023Универсальная модель с нативной мультимодальностью, рассчитанная на очень длинный контекст
Doubao
2023Универсальная диалоговая модель и приложение ByteDance
Siri
2011Ранний голосовой ассистент, принёсший управление голосом в массовые телефоны
Связанные организации
Типичное применение
- Audiobooks and news reading
- Accessibility reading and assistive narration
- Navigation prompts, podcasts and dubbing
- Support and smart-device response audio
Как её оценивают
- MOS
- Mean opinion score for naturalness
- Intelligibility (WER)
- Re-transcribing the output to measure how much is misheard
- Speaker similarity
- Closeness to the target timbre
Границы и трудности
- Pauses and stress in long sentences sound unnatural, making whole passages feel flat
- Numbers, proper nouns and polyphonic characters are misread, and one normalisation slip derails the sentence
- Control over emotion and style is coarse; only a few systems let you finely set pace and mood
Концепции в основе
Автоэнкодеры и вариационные автоэнкодеры
Сжать информацию через «бутылочное горлышко», а затем восстановить её
Механизм внимания
Каждая позиция может напрямую «видеть» все остальные и динамически распределять внимание по релевантности
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге