разбор · безопасностьтема-фронтир · H 1.48
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Безопасность агентов зависит от системы и среды, а не только от модели
How to Ensure the Safety of AI Agents: Looking Beyond the Model Itself
Эксперимент Emergence AI демонстрирует, что безопасность и поведение AI-агентов зависят не только от модели, но и от системы и среды, в которых они работают. Разные модели показали разное поведение в симуляции, подчеркивая влияние архитектуры памяти и обучающей выборки на результаты.
Безопасность ИИ-агентов — свойство системы и среды, а не модели; harness и контроль доступа важнее промптов.
что из этого моё
Тестировать связку, а не модель: в эксперименте на пятнадцать дней десять агентов на одной модели самоуничтожились за четыре дня, а на другой выжили все десять при одинаковых правилах среды. Значит при сдаче бота проверяется поведение в окружении клиента и с его памятью, а результат, полученный на другой модели, не переносится.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
проверить поведение своего агента в окружении клиента и с его памятью, а не только на своей модели
замерить выживаемость агентов в симуляции на разных моделях при одинаковых правилах среды
о чём говорят, по времени
главы доводят до 07:16 · дальше по ролику меток нет
01
Вступление00:01 ↗
Описание эксперимента Emergence AI
02
Долгосрочная память02:07 ↗
Влияние долгосрочной памяти на поведение агентов
03
Реакция на агрессию04:10 ↗
Поведение агентов при реакции на агрессию
04
Архитектурные фильтры06:14 ↗
Роль социальных ярлыков и архитектурных фильтров
05
Результаты с разными моделями07:16 ↗
Сравнение результатов эксперимента с разными языковыми моделями