разбор · бенчмарки
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
SWE-Bench Verified исчерпан: переход на SuperBench Pro
The End of SWE-Bench Verified — Mia Glaese & Olivia Watkins, OpenAI Frontier Evals
Bench Verified, популярный бенчмарк для оценки кодирования ИИ, исчерпал себя из-за насыщения и загрязнения данных. Команда OpenAI рекомендует перейти к более сложным и чистым бенчмаркам, например, SuperBench Pro, чтобы реально измерять прогресс моделей.
SWE-bench Verified устарел: насыщен, загрязнён, с дефектами. Переходим на SWE-bench Pro и ищем новые метрики.
что из этого моё
Проектировать приёмку так, чтобы её нельзя было пройти угадыванием: в разборе модель решала задачу, потому что в условии не назвали нужный аргумент, а она вытащила его из самих тестов. У бота на заказе то же самое — проверка на подготовленных примерах ничего не доказывает. Отсюда же взять отказ считать результатом десятые доли процента на насыщенном тесте.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
вынести правило про канарейки в конфиг конвейера разборов
переписать проверку бота на подготовленных примерах на скрытые тесты
о чём говорят, по времени
главы доводят до 06:45 · дальше по ролику меток нет
01
Введение и знакомство00:04 ↗
Представление спикеров и их ролей в OpenAI и Frontier Evals.
02
Проблемы SWE-Bench Verified01:06 ↗
Почему Benchmark перестал адекватно измерять прогресс моделей.
03
История и создание SWE-Bench Verified02:07 ↗
Как создавался бенчмарк и сколько усилий было вложено.
04
Примеры загрязнения и несправедливости тестов05:44 ↗
Конкретные случаи, когда тесты несправедливы или задачи загрязнены.
05
Глубокий анализ проблем и выводы06:45 ↗
Исследование, почему модели не решают некоторые задачи.