Для улучшения качества аудиоданных для обучения ASR моделей важно оценивать качество транскриптов через ручную разметку и применять фильтрацию с помощью draft-моделей и CTC-выравнивания. Фильтрация плохих примеров значительно повышает качество обучения и итоговую точность моделей.
Audio Dataset Cleaning: All that glisters is not Gold
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Важность качества транскриптов
Качество транскриптов напрямую влияет на эффективность обучения моделей распознавания речи и синтеза. Даже популярные датасеты могут содержать ошибки, ухудшающие результаты.
Для оценки качества датасета рекомендуется ручная разметка небольшого количества примеров и подсчет WER по ним, что даёт объективную метрику для дальнейших действий.
Сравнение модели и датасета
Если базовая модель распознаёт аудио точнее, чем качество датасета, дообучение на таком датасете не даст улучшений.
В этом случае нужно либо отфильтровать датасет, оставив только качественные примеры, либо сгенерировать draft labels с помощью сильной модели, чтобы получить лучший источник для обучения.
Методы фильтрации данных
Edge error detection — сравнение концов транскриптов draft-модели и исходных для выявления несовпадений и удаления плохих примеров.
CTC-выравнивание — использование модели для оценки уверенности каждого символа, с последующим отбрасыванием строк с низкой уверенностью.
Применение фильтрации на практике
Фильтрация позволяет улучшить качество датасета и повысить точность модели на целевом наборе данных, снижая деградацию на других тестах.
Без фильтрации плохие строки ухудшают модель, особенно заметно на разных доменах (скрипт vs спонтанная речь).
Практические рекомендации
Если нет ресурсов на ручную фильтрацию, можно использовать сильную open-source модель для генерации draft labels, которые зачастую почти не уступают отфильтрованным данным.
Важно всегда начинать с оценки качества исходных данных, чтобы выбрать оптимальную стратегию очистки и дообучения.