Интерпретируемость моделей выходит из научной плоскости в реальные кейсы: мониторинг, защита данных, научные открытия. Ключевые техники — доступ к внутренним признакам модели, выявление и подавление персональных данных, анализ запоминания и редактирование знаний.
[State of MechInterp] SAEs in Production, Circuit Tracing, AI4Science, "Pragmatic" Interp — Goodfire
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 4 глав ↓
Введение в Goodfire
Goodfire — компания, занимающаяся исследованием и практическим применением интерпретируемости моделей, чтобы сделать их более прозрачными и надежными для использования в критичных сферах.
Основной фокус — научная база и создание платформы для интерпретации моделей разных типов и областей.
Практические кейсы интерпретируемости
Использование интерпретируемости для создания интерфейса, где можно напрямую «рисовать» в ментальной карте модели, управляя внутренними понятиями без текстовых промптов.
Это расширяет возможности взаимодействия с моделями и открывает новые сценарии использования, выходящие за рамки стандартных API.
Исследования по запоминанию моделей
Модели запоминают данные по-разному: от простого воспроизведения фактов до сложного рассуждения, что важно учитывать при редактировании или подавлении информации.
Это усложняет задачи удаления или обновления знаний в модели, требует новых подходов к управлению памятью моделей.
Реальные внедрения и кейсы
Использование интерпретируемых моделей для автоматического выявления и удаления персональных данных в чатах с агентами, что дешевле и эффективнее традиционных методов.
Применение в научных областях (геномика, материаловедение) для открытия новых биомаркеров и других научных результатов, где модели сложны и непрозрачны.