Рекомендации по выбору ASR-моделей на 2026 год с учётом качества, размера и языковой поддержки. Лучшие проприетарные — Eleven Labs Scribe V2 и Speechmatics, среди open source — Voxstral, Qwen, Parakeet и Moonshine. Оценка и обучение моделей удобно делать через Trelis Studio с унифицированным API.
Top Transcription / ASR Models in 2026
полный разбор ролика · 5 глав ↓
Обзор моделей ASR
Проприетарные модели Eleven Labs Scribe V2 и Speechmatics показывают высокое качество, особенно для многоязычности.
Open source лидеры — Voxstral и Qwen, Parakeet подходит для on-device с 0.6 млрд параметров, Moonshine — самый компактный и энергоэффективный.
Датасет и оценка
Датасет содержит сложные AI-термины и сущности, что позволяет тестировать модели на реальных сложностях.
Оценка ведётся по character error rate и отдельно по ошибкам на ключевых сущностях, чтобы выявить слабые места моделей.
Результаты и рекомендации
Assembly AI и Voxstral показывают лучшие результаты, Whisper остаётся актуальным благодаря широкой поддержке.
Для on-device рекомендуют Parakeet, для очень компактных решений — Moonshine Tiny/Base, Qwen хорош для многоязычности.
Работа с Trelis Studio
В Trelis Studio можно подключить HuggingFace и Weights&Biases для удобного управления моделями и результатами.
Trelis Router предоставляет единый API для доступа к разным ASR-моделям, упрощая интеграцию и тестирование.
Подготовка и генерация датасетов
Можно загружать аудиофайлы и автоматически транскрибировать их выбранной моделью с последующим редактированием.
Настройки позволяют контролировать длину аудиочанков, фильтрацию по качеству и распределение данных на train/validation/test.