разбор · аср
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Фильтрация аудиоданных через draft-модели и CTC-выравнивание
Audio Dataset Cleaning: All that glisters is not Gold
Для улучшения качества аудиоданных для обучения ASR моделей важно оценивать качество транскриптов через ручную разметку и применять фильтрацию с помощью draft-моделей и CTC-выравнивания. Фильтрация плохих примеров значительно повышает качество обучения и итоговую точность моделей.
Всегда оценивайте WER датасета вручную, фильтруйте через edge/CTC, иначе обучение ухудшит модель.
что из этого моё
Оператору входа в AI полезно интегрировать фильтрацию аудиоданных на этапе подготовки датасетов для улучшения качества обучения ASR и TTS моделей, автоматизировать оценку качества через draft labels и CTC-выравнивание, а также оркестровать пайплайны с проверкой качества данных.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
запустить ручную проверку 50-100 примеров из датасета и посчитать WER
сравнить WER базовой модели и датасета, чтобы оценить потенциал улучшения
настроить фильтрацию по edge error detection с draft-моделью
о чём говорят, по времени
главы доводят до 05:32 · дальше по ролику меток нет
01
Важность качества транскриптов00:00 ↗
Почему важна чистота и точность транскриптов для обучения аудиомоделей.
02
Сравнение модели и датасета01:01 ↗
Как понять, улучшит ли датасет базовую модель.
03
Методы фильтрации данных02:33 ↗
Два основных подхода к очистке датасета — edge error detection и CTC-выравнивание.
04
Применение фильтрации на практике03:43 ↗
Результаты фильтрации на примере Vox Populi и влияние на качество моделей.
05
Практические рекомендации05:32 ↗
Как использовать открытые модели и draft labels для улучшения данных.