Voxtral — мощные open source модели для многоязычной транскрипции, с версиями для пакетной и реального времени. Они превосходят Whisper в мульти-языке и поддерживаются vLLM для масштабируемого инференса. Fine-tuning возможен через Transformers и Trelis Studio.
Train Voxtral Transcription (ASR) Models
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение в Voxtral
Voxtral — серия open source моделей для транскрипции, есть пакетные и real-time версии. Модели подходят для работы на GPU/мощных ПК, не оптимальны для слабых устройств. Они превосходят многие проприетарные решения, особенно в многоязычной среде.
Разновидности и характеристики моделей
Voxtral Mini и Small основаны на моделях Mistral с разным числом параметров, Mini Transcribe — проприетарный fine-tune. Voxtral поддерживает голос и текст на входе, что расширяет функционал. Whisper сильнее на английском, Voxtral — в мульти-языке.
Реальное время и производительность
Реальное время достигается с задержкой от 0,08 до 2,5 секунд, что улучшает качество за счёт контекста. Real-time модель близка по качеству к Mini Transcribe V2 и превосходит ряд проприетарных конкурентов.
Файнтюнинг и обучение
Whisper и Voxtral Mini можно fine-tune через Transformers, поддержка Unsloth для Voxtral пока в разработке. Для обучения доступны скрипты Advanced Audio и платформа Trelis Studio с no-code интерфейсом. Реальное время fine-tuning пока не поддерживается.
Архитектура и технические детали
Voxtral использует Whisper encoder и Mistral decoder, требует 30-секундные аудиочанки, что увеличивает нагрузку. Real-time модель тренируется с учётом задержки, вводит адаптивные нормы для поддержки разных задержек.