Масштабируемые трансформеры для белков выявляют эволюционные закономерности и способны предсказывать структуры и функции белков без предварительных биологических знаний. Это позволяет создавать модели, которые не только предсказывают, но и проектируют белки, открывая новые возможности для биоинформатики и биотехнологий.
🔬 The Bitter Lesson is Coming for Proteins - Alex Rives, BioHub
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 4 глав ↓
Введение в ESMC
ESMC использует предсказательные модели для поиска белков, удовлетворяющих заданным критериям, включая дизайн антител и белковых связывающих молекул.
Подход основан на масштабируемых языковых моделях, которые обучаются предсказывать аминокислоты в белковых последовательностях, выявляя эволюционные закономерности.
История и мотивация
Белковые последовательности содержат эволюционные паттерны, отражающие биологические ограничения, что позволяет языковым моделям учиться на этих данных.
Модель учится предсказывать аминокислоты, учитывая взаимодействия между позициями, что аналогично языковому моделированию, но с биологической специфичностью.
Модель ESM и её развитие
ESM — серия моделей, последняя из которых открыта под MIT-лицензией и включает предсказание структуры белков.
Создана масштабная база из 6.8 млрд белковых последовательностей, структурно кластеризованных для эффективного предсказания.
Интерпретируемость и sparse autoencoders
Использование sparse autoencoders позволяет выявить иерархическую структуру признаков, соответствующую биологическим знаниям, без предварительной информации.
Это помогает понять, как модель кодирует биологическую информацию и связывает эволюционно удалённые белки по функциональным и структурным признакам.