разбор · интерпретируемость
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Интерпретируемость: sidecar-модели для защиты данных и визуальные интерфейсы
[State of MechInterp] SAEs in Production, Circuit Tracing, AI4Science, "Pragmatic" Interp — Goodfire
Интерпретируемость моделей выходит из научной плоскости в реальные кейсы: мониторинг, защита данных, научные открытия. Ключевые техники — доступ к внутренним признакам модели, выявление и подавление персональных данных, анализ запоминания и редактирование знаний.
Интерпретируемость ИИ становится практическим инструментом: от удаления PII до творчества, сохраняя баланс нау
что из этого моё
Ставить рядом с клиентским чат-ботом отдельную маленькую модель-надзиратель, которая вычищает из переписки телефоны, почту и имена: в разобранном кейсе это дало точность уровня GPT-5 в роли судьи при цене примерно в 500 раз ниже. Всё остальное в разговоре — исследовательская кухня без готовых к работе инструментов.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
вынести в отдельный сервис модель-надзиратель, которая вычищает телефоны, почту и имена из переписки клиентского чат-бота
замерить точность и стоимость модели-надзирателя на своих данных с чат-ботом
настроить визуальный интерфейс для взаимодействия с внутренними признаками своей модели
о чём говорят, по времени
главы доводят до 08:21 · дальше по ролику меток нет
01
Введение в Goodfire00:02 ↗
Кто такие Goodfire и чем занимаются в интерпретируемости моделей.
02
Практические кейсы интерпретируемости03:09 ↗
Пример с визуальным доступом к внутренним концепциям Stable Diffusion.
03
Исследования по запоминанию моделей04:41 ↗
Как модели хранят и воспроизводят знания, отличие запоминания от логического вывода.
04
Реальные внедрения и кейсы08:21 ↗
Применение интерпретируемости в промышленности и науке.