Trelis Tiron — открытая модель для точной транскрипции и атрибуции до 8 спикеров в длинных встречах с наложениями речи. Использует двухпроходную обработку с перекрывающимися чанками для улучшения связывания спикеров и выдаёт результаты с таймкодами в разных форматах.
Trelis Tiron - State-of-the-Art Multi-speaker Meeting Transcription and Attribution (Open Weights!)
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение в Trelis Tiron
Trelis Tiron — новая модель, превосходящая по точности и функционалу многие коммерческие и открытые решения для распознавания речи с несколькими спикерами.
Она способна работать с длинными аудио и атрибутировать речь до 8 человек, включая перекрывающуюся речь.
Демонстрация и доступность
Модель и инструменты доступны на Trelis.com и HuggingFace с открытыми весами и исходным кодом.
Можно загрузить аудио и получить транскрипцию с атрибуцией спикеров через UI или API.
Технические детали модели
Trelis Tiron базируется на Whisper Large с дообучением, использует 30-секундные чанки с точными таймкодами и разделением по спикерам.
Вывод структурирован по спикерам: сначала все реплики первого, затем второго и так далее, что упрощает последующую обработку.
Обработка и связывание чанков
Аудио разбивается на энергетические чанки, транскрибируется и затем спикеры связываются между чанками с помощью эмбеддингов E-kappa.
Двойной проход с разными сдвигами чанков позволяет повысить уверенность в связывании и корректировать ошибки.
Сравнение и результаты
Модель превосходит Gemini Pro на длинных встречах и близка к Assembly AI, но всё ещё имеет высокий уровень ошибок на сложных данных.
Тем не менее, Trelis Tiron — лучшее открытое решение для комплексной транскрипции с атрибуцией и таймкодами.