разбор · бенчмарк
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
DeepSWE: бенчмарк против контаминации с короткими промптами
DeepSWE: A Contamination-Resistant Coding Benchmark — James Shi, Datacurve
DeepSWE — новый бенчмарк для оценки моделей на длинных задачах кодинга, созданный с нуля для защиты от контаминации. Ключевые находки: сильные модели склонны тестировать свою работу, а промпты должны быть краткими и реалистичными.
DeepSWE — авторские задачи вместо скрейпинга PR, короткие промпты, проверка поведения, защита от контаминации
что из этого моё
Можно использовать подход DeepSWE для создания собственных оценочных задач: писать их с нуля, делать промпты краткими и реалистичными, а проверку строить на поведении, а не на деталях реализации. Это повысит качество оценки агентов и снизит риск контаминации.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать промпты в конвейере разборов, сократив их вдвое и убрав лишние инструкции
заблокировать доступ агента к git-истории при оценке его правок
настроить проверку решений по наблюдаемому поведению, а не по реализации
о чём говорят, по времени
главы доводят до 07:30 · дальше по ролику меток нет
01
Введение и мотивация00:00 ↗
Джеймс представляет DeepSWE и объясняет, почему существующие бенчмарки неэффективны.
02
Качественные наблюдения02:30 ↗
Анализ поведения разных моделей: Claude, GPT и другие.
03
Методология DeepSWE05:00 ↗
Как создаются задачи и почему они лучше.
04
Планы развития07:30 ↗
Что планируется улучшить в будущем.