Видео показывает, как выровнять аудио и текст для точных временных меток в транскриптах, что важно для подготовки данных и обучения моделей распознавания речи. Демонстрируется использование двух моделей для выравнивания и создание чистых аудио-чанков по предложениям.
Align Audio and Text for Speech Recognition Model Training
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение в выравнивание
Выравнивание аудио и текста нужно для получения точных временных меток в транскриптах, что важно для обучения моделей типа Whisper и Kyutai.
Точные метки позволяют разбивать данные на чанки по предложениям, улучшая качество обучающих выборок.
Демонстрация моделей выравнивания
Показано, как загружается аудио и транскрибируется текст с помощью Fireworks.
Используются две модели: MMS-FA (Torch Audio, устаревающая) и CTC aligner (свободная, коммерчески разрешённая).
Обе модели выдают временные метки слов, что позволяет создавать точные аудио-чанки.
Технические детали выравнивания
Текст нормализуют (без пунктуации, в нижнем регистре), затем создают эмиссии — вероятности символов для каждого аудио-фрейма.
Далее применяется алгоритм Витерби для поиска наиболее вероятной последовательности символов, обеспечивающей точное выравнивание.
Практическое применение в Trelis Studio
В Trelis Studio загружают аудио, транскрибируют и корректируют текст, затем проводят выравнивание для получения чистых чанков по предложениям.
Чанки длиной 20-30 секунд с аккуратными границами предложений обеспечивают лучшее качество обучающих данных для моделей.
Код и запуск сервера выравнивания
Функция выравнивания принимает аудио, текст, опцию сохранения оригинального форматирования, выбор модели и язык.
Аудио конвертируется в тензор, разбивается на чанки, для каждого генерируются эмиссии вероятностей символов, после чего применяется алгоритм Витерби для финального выравнивания.