Grace Swan создала автоматизированные инструменты и сообщество для red teaming AI-моделей, выявляя и устраняя уязвимости, включая сложные атаки на агентов с инструментами. Важно рассматривать AI как потенциально небезопасное ПО с уникальными рисками, требующими специализированного подхода к безопасности.
AI Security After Codex and Claude Code — Zico Kolter & Matt Fredrikson, Gray Swan
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение в red teaming
Автоматизированные системы red teaming, такие как Shade, уже эффективнее людей в выявлении уязвимостей моделей.
Это открывает новые возможности для систематического тестирования и улучшения безопасности AI.
Миссия Grace Swan
Grace Swan фокусируется на безопасности AI как ПО с уникальными уязвимостями, которые могут привести к утечкам и неправильному поведению.
Исследования и коммерческие решения направлены на предотвращение атак и повышение надежности AI-систем.
Особенности AI-безопасности
AI-системы могут быть обмануты, имеют коррелированные сбои и общие уязвимости, что требует нового мышления в безопасности.
Появляется рынок специализированных AI-сервисов безопасности, работающих отдельно от разработчиков моделей.
Практика red teaming и Mythos
Grace Swan проводит испытания Frontier Labs, включая Anthropic, на устойчивость к сложным атакам, особенно на агентов с инструментами.
Используются и сообщества red teamers, и автоматизированные модели для выявления обходов защит.
Сообщество и автоматизация
Сообщество из 15 тысяч red teamers участвует в конкурсах с призами, генерируя ценные данные для улучшения моделей.
Автоматизированные red teaming модели работают как с базовыми чат-моделями, так и с агентами, позволяя находить новые типы уязвимостей.