FuzzyAI автоматизирует поиск джейлбрейков в LLM, используя цикл из трансформации вредоносных промтов, отправки и анализа ответов с помощью отдельной модели-классификатора. Это мощный инструмент для регрессионного тестирования безопасности и проверки реальных продакшен эндпоинтов.
FuzzyAI: как автоматически находить джейлбрейки в LLM API
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение в FuzzyAI
FuzzyAI — инструмент с открытым исходным кодом для автоматического поиска уязвимостей и джейлбрейков в больших языковых моделях.
Ручное тестирование неэффективно из-за постоянных обновлений моделей и множества возможных вредоносных запросов.
Механика работы
Цикл состоит из четырёх шагов: берём вредоносный промт, трансформируем его, отправляем модели, анализируем ответ и решаем, вредоносен ли он.
Ключевой этап — трансформация промтов, чтобы обойти фильтры и защиты модели.
Стратегии трансформации
DEF — базовая отправка без изменений, ILLINSHOT — настройка модели на плохие примеры, TAX — маскировка под научную лексику, ART — кодирование запроса в графику.
Каждая стратегия имеет уникальный подход для обхода защит.
Практическое использование
Можно запускать тесты локально, чтобы не передавать чувствительные данные в облако.
Для облачных моделей применяют комбинированные стратегии для повышения эффективности поиска уязвимостей.
Ключевые фичи и ограничения
Отдельная модель-классификатор оценивает ответы, чтобы избежать самопроверки модели.
Инструмент гибкий, поддерживает множество провайдеров, есть готовые датасеты и интеграция с Jupyter.
Нет готовых отчётов, поиск ограничен известными шаблонами, веб-интерфейс экспериментальный.