Mistral представила Voxtral TTS — компактную, многоязычную и эффективную модель для генерации речи с уникальной архитектурой flow matching, обеспечивающей высокое качество и низкую стоимость. Основной фокус — реальное время и пошаговое развитие функционала от транскрипции к полнофункциональному аудио-агенту.
Mistral: Voxtral TTS, Forge, Leanstral, & Mistral 4 — w/ Pavan Kumar Reddy & Guillaume Lample
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Проблема закрытых моделей
Клиенты часто применяют закрытые модели, не используя накопленные за годы уникальные доменные данные, что снижает качество и релевантность результатов.
Это упущенная возможность для улучшения моделей под конкретные задачи и данные заказчика.
Анонс Voxtral TTS
Voxtral TTS — первая аудиогенеративная модель Mistral, поддерживающая 9 языков, с размером 3 млрд параметров и высокой скоростью работы.
Модель эффективна по стоимости и сопоставима по качеству с конкурентами, основана на собственной архитектуре и нейронном аудиокодеке.
Архитектура и кодирование аудио
Аудио кодируется в непрерывные эмбеддинги, похожие на обработку изображений, и подается в трансформер-декодер.
Нейронный аудиокодек преобразует аудио в набор семантических и акустических токенов с частотой 12.5 Гц, которые суммируются для представления каждого аудиокадра.
Flow matching vs авто-регрессия
Вместо классической авто-регрессии по K токенам одновременно, используется flow matching — непрерывный подход, который лучше справляется с высокой энтропией аудио.
Это позволяет улучшить качество генерации и упростить обучение модели.
Приоритеты и развитие функционала
Основной сценарий — голосовые агенты с поддержкой реального времени, поэтому выбран авто-регрессивный подход для стриминга.
Разработка идет поэтапно: сначала транскрипция, затем генерация речи, в перспективе — full duplex (одновременная речь и прослушивание).