← Материалы разборы Yersham
разбор · asrбалл 8.0#260 из 823 · 2026-03-25

Voxtral — мощные open source модели для многоязычной транскрипции, с версиями для пакетной и реального времени. Они превосходят Whisper в мульти-языке и поддерживаются vLLM для масштабируемого инференса. Fine-tuning возможен через Transformers и Trelis Studio.

Train Voxtral Transcription (ASR) Models

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Оператору buyanov.io полезно интегрировать Voxtral для построения многоязычной транскрипции в оркестрации агентов и автоматизации рабочих процессов, используя vLLM для масштабируемого инференса и Trelis Studio для кастомного fine-tuning.

карта разбора · 5 ветокклик по цифре — раскрыть главу
суть01Введение в Voxtral02Разновидности и хар…03Реальное время и пр…04Файнтюнинг и обучен…05Архитектура и техни…

наведи и нажми на цифру — раскроется глава

полный разбор ролика · 5 глав
01

Введение в Voxtral

Voxtral — серия open source моделей для транскрипции, есть пакетные и real-time версии. Модели подходят для работы на GPU/мощных ПК, не оптимальны для слабых устройств. Они превосходят многие проприетарные решения, особенно в многоязычной среде.

02

Разновидности и характеристики моделей

Voxtral Mini и Small основаны на моделях Mistral с разным числом параметров, Mini Transcribe — проприетарный fine-tune. Voxtral поддерживает голос и текст на входе, что расширяет функционал. Whisper сильнее на английском, Voxtral — в мульти-языке.

03

Реальное время и производительность

Реальное время достигается с задержкой от 0,08 до 2,5 секунд, что улучшает качество за счёт контекста. Real-time модель близка по качеству к Mini Transcribe V2 и превосходит ряд проприетарных конкурентов.

04

Файнтюнинг и обучение

Whisper и Voxtral Mini можно fine-tune через Transformers, поддержка Unsloth для Voxtral пока в разработке. Для обучения доступны скрипты Advanced Audio и платформа Trelis Studio с no-code интерфейсом. Реальное время fine-tuning пока не поддерживается.

05

Архитектура и технические детали

Voxtral использует Whisper encoder и Mistral decoder, требует 30-секундные аудиочанки, что увеличивает нагрузку. Real-time модель тренируется с учётом задержки, вводит адаптивные нормы для поддержки разных задержек.

#asr#оркестрация#fine-tuning#vllm
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы