MOS TTS Nano — лёгкая мультиязычная модель TTS на 0,1 млрд параметров, способная работать на CPU без GPU и облаков. Она подходит для локального синтеза речи в ограниченных по ресурсам средах с высокой скоростью и низкой задержкой.
MOSS-TTS-Nano: TTS на 0.1B параметрах прямо на CPU
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение и проблема GPU
Большинство современных TTS-систем требуют мощный GPU, что неудобно для периферийных устройств и бессерверных функций.
Облачные API создают задержки, расходы и зависят от интернета, что неприемлемо для IoT и изолированных сред.
Знакомство с MOS TTS Nano
Модель весит всего 0,1 млрд параметров, что в 3-10 раз меньше типичных TTS-моделей.
Процесс синтеза состоит из кодирования эталонного аудио, генерации токенов и финального синтеза с клонированием голоса Zero Shot.
Архитектура PyTorch vs ONX
PyTorch — привычная, но тяжёлая среда выполнения.
ONX — более эффективный бэкенд, позволяющий запускать модель на одном ядре CPU без PyTorch, почти в 2 раза быстрее.
Практическое развёртывание
Для пакетной обработки использовать скрипты infer.py.
Для локального интерфейса доступно веб-демо.
CLI позволяет быстро поднять локальный HTTP эндпоинт для интеграции.
Ограничения и рекомендации
Качество звука подходит для реального времени, но не для студийного уровня.
ONX-версия пока ранняя, нужно фиксировать версии по коммитам.
Для стабильного клонирования голоса рекомендуется тонкая настройка модели, а не только Zero Shot.