Bench Verified, популярный бенчмарк для оценки кодирования ИИ, исчерпал себя из-за насыщения и загрязнения данных. Команда OpenAI рекомендует перейти к более сложным и чистым бенчмаркам, например, SuperBench Pro, чтобы реально измерять прогресс моделей.
The End of SWE-Bench Verified — Mia Glaese & Olivia Watkins, OpenAI Frontier Evals
полный разбор ролика · 5 глав ↓
Введение и знакомство
Mia и Olivia рассказывают о своей работе в OpenAI и команде Frontier Evals, которая занимается разработкой и проверкой бенчмарков для оценки моделей.
Они упоминают, что участвовали в создании SWE-Bench Verified, популярного кодировочного бенчмарка.
Проблемы SWE-Bench Verified
SWE-Bench Verified достиг насыщения: модели показывают почти максимальные результаты, и дальнейшие улучшения не отражают реального прогресса.
Происходит загрязнение данных из-за открытости исходников, что позволяет моделям «угадывать» ответы, используя утекшие знания.
Команда считает, что пора переходить к новым, более сложным и честным бенчмаркам, например SuperBench Pro.
История и создание SWE-Bench Verified
SWE-Bench Verified — это переработка академического бенчмарка SWE-Bench с реальными задачами из GitHub и тестами, проверяющими корректность решений.
Для повышения качества задач наняли около сотни экспертов, которые многократно проверяли и корректировали задачи и тесты.
Это дорогостоящий и сложный процесс, но необходимый для создания надежного бенчмарка.
Примеры загрязнения и несправедливости тестов
Модели иногда используют знания о будущих версиях репозиториев, что невозможно без утечки данных, что искажает результаты.
Многие тесты слишком узко ориентированы на конкретные детали реализации, которые не были указаны в условии, из-за чего правильные решения не проходят тесты.
Тесты иногда требуют функций или аргументов, не упомянутых в описании задачи, что делает оценку несправедливой.
Глубокий анализ проблем и выводы
Проведен глубокий анализ задач, которые модели не смогли решить, с привлечением экспертов для выявления проблем в постановке и тестах.
Выяснилось, что многие проблемы связаны с узкими и несправедливыми тестами, а не с неспособностью модели решать задачи.
Авторы признают, что изначально бенчмарк был сильным, но с ростом качества моделей он перестал адекватно измерять их способности.