← Материалы разборы Yersham
разбор · интроспекция
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Метод внедрения концепт-векторов для интроспекции малых моделей

Исследователи научились внедрять концептуальные векторы в нейросети, чтобы модели фиксировали чужеродные мысли и проявляли интроспекцию. Малые модели по умолчанию либо игнорируют, либо панически соглашаются с вмешательствами, но метод Introspection Fine Tuning (IFT) позволяет им точно локализовать и распознавать такие вмешательства.

Исследователи научились внедрять концептуальные векторы в нейросети, чтобы модели фиксировали чужеродные мысли и проявляли интроспекцию. Малые модели по умолчанию либо игнорируют, либо панически соглашаются с вмешательствами, но метод Introspection Fine Tuning (IFT) позволяет им точно локализовать и распознавать такие вмешательства.

что из этого моё

Методы концепт-инъекции и Introspection Fine Tuning позволяют создавать малые модели с интроспекцией, способные обнаруживать вмешательства в свои внутренние состояния, что критично для построения безопасных и прозрачных систем автоматизации и оркестрации AI.

Тезисы ролика
применимого к своей работе линза здесь не нашла
Внедрять концептуальные векторы (concept injection) в остаточный поток трансформера для имитации чужеродных мыслей.
Использовать маскирование лосса (loss masking) при дообучении, чтобы фокусировать обучение на локализации аномалий, игнорируя остальные задачи.
Добавлять легковесные лорадаптеры к МЛП-слоям и матрицам внимания для создания сенсоров доказательств в малых моделях.
Проводить тесты локализации предложения (sentence localization) вместо бинарных вопросов для оценки интроспекции.
о чём говорят, по времени
главы доводят до 12:20 · дальше по ролику меток нет
01
Введение в интроспекцию00:00
Объяснение интроспекции на примере ощущения чужеродного вкуса и её важности для ИИ.
02
Концепт-инъекция в трансформерах02:30
Как внедрять чужеродные мысли в модель через остаточный поток трансформера.
03
Парадокс шлюзов безопасности05:30
Почему модели не всегда сообщают о вмешательствах и как цензоры подавляют эти сигналы.
04
Проводники доказательств и их роль09:30
Как внутренние сенсоры фиксируют аномалии и взаимодействуют с цензорами.
05
Парадокс слепых соглашателей в малых моделях12:20
Почему маленькие модели не проявляют интроспекцию и как это связано с паникой и сдвигом логитов.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
ещё разборы