OmniASR — модель для транскрипции 1600+ языков, включая редкие, с хорошей базовой точностью, но без пунктуации и капитализации. Для улучшения результатов в низкоресурсных языках нужно дообучение и постобработка, включая отдельные модели пунктуации.
Transcribe 1,600+ Languages with OmniASR
полный разбор ролика · 5 глав ↓
Введение в OmniASR
OmniASR — уникальная модель Meta, покрывающая более 1600 языков, включая редкие и низкоресурсные. Она подходит для транскрипции языков с малым количеством доступных данных, где другие модели работают хуже.
Основной недостаток — отсутствие пунктуации и капитализации в выводе, что требует отдельной обработки. Модель доступна через браузер и API на router.Trelis.com.
Демонстрация и особенности
Можно задавать языковые подсказки (например, ENG или ENG-LATN) для улучшения качества транскрипции и выбора скрипта.
В демонстрации ирландского языка модель показывает хорошие результаты, но с переменной точностью. Для улучшения можно использовать подсказки языка и дообучение.
Отсутствие пунктуации и капитализации — ключевой недостаток, который решается отдельными моделями или дообучением.
Архитектура и производительность
OmniASR — это энкодер-декодер с автогрессивным декодером, обученный на аудио и текстах, что позволяет предсказывать транскрипцию с низкой ошибкой.
Модель существует в нескольких размерах — от 300 млн до 700 млрд параметров, при этом большие модели дают значительное улучшение качества по сравнению с Whisper.
Модели не поддерживают стандартные библиотеки типа transformers и vLLM, что требует организации собственной инфраструктуры для эффективного инференса и батчинга.
Few-shot и дообучение
OmniASR поддерживает добавление примеров предыдущих аудио и транскрипций (few-shot), что теоретически улучшает распознавание редких языков, но на практике эффект может быть незначительным.
Для улучшения качества пунктуации и капитализации рекомендуется дообучать отдельные модели или сам OmniASR на размеченных данных.
Можно использовать OmniASR для генерации размеченных датасетов из аудио, что снижает стоимость подготовки данных для низкоресурсных языков.
Выводы и перспективы
OmniASR значительно снижает барьер для работы с низкоресурсными языками, позволяя быстро и дешево создавать транскрипции и размеченные датасеты.
Снижение стоимости и расширение покрытия языков делает проект перспективным для бизнеса и автоматизации многоязычных решений.
Оператор входа в AI может использовать эту технологию для расширения поддержки языков и автоматизации обработки аудио с последующей оркестрацией моделей.