MisoTTS 8B — открытая TTS-модель с 8 млрд параметров на базе RVQ, которая разделяет языковую и акустическую обработку, снижая размер модели и сохраняя высокое качество речи. Модель позволяет локально генерировать и клонировать голос с точной интонацией, но требует мощного GPU и постобработки.
MisoTTS 8B: Open-Weights TTS на базе RVQ Transformer
полный разбор ролика · 5 глав ↓
Введение и обзор
MisoTTS 8B — мощная открытая модель для генерации выразительной речи, которая решает проблему масштабирования словаря, характерную для трансформеров с аудиотокенами.
Модель поддерживает только английский, но выдаёт очень естественную речь, полностью заменяя закрытые API.
Архитектура RVQ
RVQ разбивает аудиосигнал на квантованные векторы, распределённые по 32 кодовым книгам, что сохраняет акустическую точность без взрывного роста параметров.
Система состоит из двух трансформеров: большого лингвистического (8 млрд параметров) и маленького декодера (300 млн), который доводит звук до идеала.
Установка и запуск
Установка требует Python 3.0, пакетного менеджера UV, клонирования репозитория и запуска скрипта, который подтягивает веса с Hugging Face.
Для нормальной работы критичны совместимые GPU-драйверы, модель использует BFloat16 для экономии видеопамяти; без GPU генерация будет очень медленной.
Генерация и клонирование голосов
Метод generate принимает текст, ID голоса, контекст (для интонации) и максимальную длину аудио, предотвращая бесконечный цикл.
Для клонирования аудио обязательно передискретизировать под частоту генератора, иначе будут артефакты; аудио упаковывается с точной транскрипцией для контекстуальной генерации.
Ограничения и требования
Модель ограничена 2048 токенами и выдаёт максимум 10 секунд аудио, что требует логики разбиения для длинных текстов.
На выходе сырые аудиотензоры требуют внешней нормализации и постобработки, а также встроены водяные знаки для защиты от дипфейков.