В 2026 году лучшие TTS-модели показывают высокое качество звучания и точность, особенно проприетарные Gemini, GPT-4o Mini и Eleven Labs. Оценка точности проводится через roundtrip CER, а качество — через MOS, что важно учитывать при выборе модели для конкретных задач.
Top Text-to-Speech (TTS) Models in 2026
полный разбор ролика · 5 глав ↓
Введение и метрики
Автор рассказывает о подходе к сравнению TTS моделей 2026 года, используя три метрики: roundtrip CER (ошибки символов), MOS (средняя оценка качества голоса) и субъективное впечатление.
Подчёркивается, что оценка субъективна и зависит от применения, но даёт представление о сильных и слабых сторонах моделей.
Датасет Tricky TTS
Датасет включает сложные примеры: символы, сокращения, имена (в том числе ирландские), а также просодию и пунктуацию, чтобы проверить разные аспекты озвучки.
Для повышения точности рекомендуют нормализацию текста — преобразование сложных символов и сокращений в читаемую форму с помощью LLM или правил.
Нормализация и её ограничения
Нормализация, включаемая в некоторых API (например, ElevenLabs), улучшает точность, но может пропускать редкие случаи и добавляет задержку.
Использование LLM для нормализации даёт гибкость, но увеличивает латентность, что критично для приложений с низкой задержкой.
Методика оценки точности
Для оценки точности TTS используют обратную транскрипцию с помощью сильной ASR модели, сравнивая полученный текст с исходным.
Ошибки ASR влияют на оценку, поэтому сравнивают также с транскрипцией оригинальной речи, чтобы компенсировать погрешности ASR.
Результаты и анализ моделей
Проприетарные модели (Gemini, GPT-4o Mini, Eleven Labs) показывают лучшие результаты по точности и естественности голоса (MOS выше 4).
Некоторые открытые модели (Orpheus, Kokoro) демонстрируют достойное качество, особенно если тренированы на синтетических данных.
Архитектура и количество тренировочных данных сильно влияют на качество — старые модели можно улучшать дополнительным обучением.