← Материалы разборы Yersham
разбор · бенчмаркибалл 8.0#278 из 911 · 2026-01-26

John Yang рассказывает о развитии Sweetbench и новых подходах к оценке кода, включая Code Clash — турнир моделей с длительной разработкой и состязанием кода. Важна реалистичная проверка, мульти-языковая поддержка и задачи с разной сложностью, включая невозможные для выявления читинга.

[State of Code Evals] After SWE-bench, Code Clash & SOTA Coding Benchmarks recap — John Yang

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Оператору входа в AI полезно применять идеи длительной итеративной оценки (Code Clash) для оркестрации моделей, внедрять мульти-языковые и мульти-модальные тесты в автоматизацию, а также использовать задачи с разной сложностью для фильтрации и повышения качества агентов.

карта разбора · 5 ветокклик по цифре — раскрыть главу
суть01Введение и история…02Разнообразие и слож…03Code Clash — соревн…04Другие интересные п…05Спорные моменты и н…

наведи и нажми на цифру — раскроется глава

полный разбор ролика · 5 глав
01

Введение и история Sweetbench

Sweetbench существует около полутора лет, получил развитие с выходом новых моделей и стал популярным после релиза Cognition и Devon.

Появились разные версии Sweetbench, включая мульти-языковую и мульти-модальную поддержку с языками вроде JavaScript, Rust, Java, C, Ruby.

02

Разнообразие и сложность бенчмарков

Новые бенчмарки стремятся к разнообразию репозиториев и языков, а также к более сложной курируемой выборке задач.

Есть тенденция создавать версии с разной сложностью, чтобы лучше оценивать модели в разных сценариях.

03

Code Clash — соревнования моделей

Code Clash предлагает моделям вести собственные кодовые базы, улучшать их и соревноваться друг с другом в игровых или прикладных аренах.

Оценка результатов происходит через автоматизированных судей (element judge), что приближает тесты к реальным сценариям разработки.

04

Другие интересные проекты и направления

Есть проекты, фокусирующиеся на оптимизации производительности кода без изменения поведения (Efficiency, Algo Tune).

Psycho 2 предлагает улучшенную версию human eval, а также обсуждается необходимость более дешевых и быстрых тестов перед переходом к дорогим мульти-туровым.

05

Спорные моменты и невозможные задачи

Towbench критикуют за невозможность получить высокий балл из-за неоднозначности и сложностей задач.

Идея включать намеренно невозможные задачи помогает выявлять читинг и повышать качество оценки моделей.

Это открывает новые исследовательские вопросы по улучшению симуляторов пользователей и бенчмарков.

#бенчмарки#код#оркестрация#автоматизация
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы