← Материалы разборы Yersham
разбор · бенчмаркибалл 6.0#672 из 823 · 2026-02-25

Bench Verified, популярный бенчмарк для оценки кодирования ИИ, исчерпал себя из-за насыщения и загрязнения данных. Команда OpenAI рекомендует перейти к более сложным и чистым бенчмаркам, например, SuperBench Pro, чтобы реально измерять прогресс моделей.

The End of SWE-Bench Verified — Mia Glaese & Olivia Watkins, OpenAI Frontier Evals

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Оператору входа в AI полезно применять тщательную валидацию и очистку задач и тестов для оркестрации и автоматизации, чтобы не вводить модели в заблуждение и корректно оценивать их работу. Также важно использовать более надежные бенчмарки для построения метрик и контроля качества агентов.

полный разбор ролика · 5 глав
01

Введение и знакомство

Mia и Olivia рассказывают о своей работе в OpenAI и команде Frontier Evals, которая занимается разработкой и проверкой бенчмарков для оценки моделей.

Они упоминают, что участвовали в создании SWE-Bench Verified, популярного кодировочного бенчмарка.

02

Проблемы SWE-Bench Verified

SWE-Bench Verified достиг насыщения: модели показывают почти максимальные результаты, и дальнейшие улучшения не отражают реального прогресса.

Происходит загрязнение данных из-за открытости исходников, что позволяет моделям «угадывать» ответы, используя утекшие знания.

Команда считает, что пора переходить к новым, более сложным и честным бенчмаркам, например SuperBench Pro.

03

История и создание SWE-Bench Verified

SWE-Bench Verified — это переработка академического бенчмарка SWE-Bench с реальными задачами из GitHub и тестами, проверяющими корректность решений.

Для повышения качества задач наняли около сотни экспертов, которые многократно проверяли и корректировали задачи и тесты.

Это дорогостоящий и сложный процесс, но необходимый для создания надежного бенчмарка.

04

Примеры загрязнения и несправедливости тестов

Модели иногда используют знания о будущих версиях репозиториев, что невозможно без утечки данных, что искажает результаты.

Многие тесты слишком узко ориентированы на конкретные детали реализации, которые не были указаны в условии, из-за чего правильные решения не проходят тесты.

Тесты иногда требуют функций или аргументов, не упомянутых в описании задачи, что делает оценку несправедливой.

05

Глубокий анализ проблем и выводы

Проведен глубокий анализ задач, которые модели не смогли решить, с привлечением экспертов для выявления проблем в постановке и тестах.

Выяснилось, что многие проблемы связаны с узкими и несправедливыми тестами, а не с неспособностью модели решать задачи.

Авторы признают, что изначально бенчмарк был сильным, но с ростом качества моделей он перестал адекватно измерять их способности.

#бенчмарки#кодирование#оцениваемость#контаминация
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы