John Yang рассказывает о развитии Sweetbench и новых подходах к оценке кода, включая Code Clash — турнир моделей с длительной разработкой и состязанием кода. Важна реалистичная проверка, мульти-языковая поддержка и задачи с разной сложностью, включая невозможные для выявления читинга.
[State of Code Evals] After SWE-bench, Code Clash & SOTA Coding Benchmarks recap — John Yang
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение и история Sweetbench
Sweetbench существует около полутора лет, получил развитие с выходом новых моделей и стал популярным после релиза Cognition и Devon.
Появились разные версии Sweetbench, включая мульти-языковую и мульти-модальную поддержку с языками вроде JavaScript, Rust, Java, C, Ruby.
Разнообразие и сложность бенчмарков
Новые бенчмарки стремятся к разнообразию репозиториев и языков, а также к более сложной курируемой выборке задач.
Есть тенденция создавать версии с разной сложностью, чтобы лучше оценивать модели в разных сценариях.
Code Clash — соревнования моделей
Code Clash предлагает моделям вести собственные кодовые базы, улучшать их и соревноваться друг с другом в игровых или прикладных аренах.
Оценка результатов происходит через автоматизированных судей (element judge), что приближает тесты к реальным сценариям разработки.
Другие интересные проекты и направления
Есть проекты, фокусирующиеся на оптимизации производительности кода без изменения поведения (Efficiency, Algo Tune).
Psycho 2 предлагает улучшенную версию human eval, а также обсуждается необходимость более дешевых и быстрых тестов перед переходом к дорогим мульти-туровым.
Спорные моменты и невозможные задачи
Towbench критикуют за невозможность получить высокий балл из-за неоднозначности и сложностей задач.
Идея включать намеренно невозможные задачи помогает выявлять читинг и повышать качество оценки моделей.
Это открывает новые исследовательские вопросы по улучшению симуляторов пользователей и бенчмарков.