Удаление цензуры из LLM через бипроекцию и heretic
В видео рассматривается процесс удаления встроенной цензуры из языковых моделей AI, сохраняя при этом их интеллектуальные способности. Исследователи используют математические методы, такие как сохраняющая норму бипроекция, для удаления направления отказа без ущерба для общей эффективности модели. Применение таких модифицированных моделей может быть полезным для оператора входа в AI, особенно в контексте оркестрации и автоматизации.
Отказ — вектор, который можно стереть бипроекцией, сохранив интеллект; локальный запуск и red teaming меняют б
Оператору входа в AI можно использовать методы облитерации для создания более эффективных и беспристрастных моделей, что улучшит оркестрацию и автоматизацию процессов без ущерба для интеллектуальных способностей AI.