← Материалы разборы Yersham
разбор · бенчмарки
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

SWE-Bench Verified исчерпан: переход на SuperBench Pro

The End of SWE-Bench Verified — Mia Glaese & Olivia Watkins, OpenAI Frontier Evals

Bench Verified, популярный бенчмарк для оценки кодирования ИИ, исчерпал себя из-за насыщения и загрязнения данных. Команда OpenAI рекомендует перейти к более сложным и чистым бенчмаркам, например, SuperBench Pro, чтобы реально измерять прогресс моделей.

SWE-bench Verified устарел: насыщен, загрязнён, с дефектами. Переходим на SWE-bench Pro и ищем новые метрики.

что из этого моё

Проектировать приёмку так, чтобы её нельзя было пройти угадыванием: в разборе модель решала задачу, потому что в условии не назвали нужный аргумент, а она вытащила его из самих тестов. У бота на заказе то же самое — проверка на подготовленных примерах ничего не доказывает. Отсюда же взять отказ считать результатом десятые доли процента на насыщенном тесте.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
вынести правило про канарейки в конфиг конвейера разборов
переписать проверку бота на подготовленных примерах на скрытые тесты
о чём говорят, по времени
главы доводят до 06:45 · дальше по ролику меток нет
01
Введение и знакомство00:04
Представление спикеров и их ролей в OpenAI и Frontier Evals.
02
Проблемы SWE-Bench Verified01:06
Почему Benchmark перестал адекватно измерять прогресс моделей.
03
История и создание SWE-Bench Verified02:07
Как создавался бенчмарк и сколько усилий было вложено.
04
Примеры загрязнения и несправедливости тестов05:44
Конкретные случаи, когда тесты несправедливы или задачи загрязнены.
05
Глубокий анализ проблем и выводы06:45
Исследование, почему модели не решают некоторые задачи.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы