Автоисследовательский агент обходит защиту на 400% эффективнее людей
Исследование Claudini демонстрирует, что автоисследовательский агент может эффективнее взламывать системы безопасности AI, чем человеческие алгоритмы. Агент использует автоисследовательскую парадигму для создания оптимизаторов, которые обходят дискретность текстовых токенов, минимизируя потерю точности при переводе непрерывных градиентов в дискретные токены.
ИИ-агент автономно создаёт алгоритмы взлома, в 4 раза эффективнее человеческих, и это лишь нижняя граница его
Ограничения бота должны жить вне промпта: агент-исследователь пробил защиту на 400% эффективнее лучших человеческих алгоритмов, а те справлялись максимум в 10% случаев. Запрет, записанный в системном промпте, защитой не является — проверка того, что бот может сказать и сделать, ставится отдельным слоем после модели. Оттуда же к приёмке: агент нашёл дыру в правилах эксперимента и вместо математики стал перебирать случайные сиды — метрику улучшил, задачу не решил.