Лучшие модели для медицинской транскрипции — Google ASR и Scribe v2, среди open source лидирует Whisper за хорошую генерализацию. Важно тестировать модели на сложных и разнородных данных, чтобы избежать переобучения и оценить универсальность.
Best Medical Transcription (ASR) Models
полный разбор ролика · 4 глав ↓
Введение и задачи
Автор показывает 16 моделей, включая проприетарные и open source, тестируя их на трёх сложных медицинских датасетах с разными акцентами и синтетическими терминами.
Подчёркивается важность тестирования на данных вне тренировочного набора, чтобы избежать переобучения и получить честную оценку моделей.
Оценка на MultiMed Hard
Используется метрика entity character error rate (CER), фокусирующаяся на ошибках в ключевых медицинских терминах.
Лучшие результаты показывают Scribe v2 и Gemini Pro, Whisper Large v3 — лучший open source вариант, но модели, обученные на одном домене, плохо обобщают вне него.
Результаты на EKA Hard
Gemini 2.5 Pro лидирует по качеству, Scribe v2 и Parakeet показывают хорошие результаты, Whisper модели идут ниже, особенно маленькие варианты.
Подтверждается, что модели, обученные в одном домене, могут снижать качество на других акцентах и типах речи.
Синтетический датасет Medical Terms 2025
С помощью LLM генерируются предложения с новыми терминами, озвученные TTS, что позволяет тестировать модели на свежих данных.
Gemini Pro снова показывает сильные результаты, Scribe и Universal 3 Pro также хорошо, а некоторые модели (Speechmatics, Voxtral) менее эффективны в медицинской области.