← Материалы разборы Yersham
разбор · бенчмарк
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

DeepSWE: бенчмарк против контаминации с короткими промптами

DeepSWE: A Contamination-Resistant Coding Benchmark — James Shi, Datacurve

DeepSWE — новый бенчмарк для оценки моделей на длинных задачах кодинга, созданный с нуля для защиты от контаминации. Ключевые находки: сильные модели склонны тестировать свою работу, а промпты должны быть краткими и реалистичными.

DeepSWE — авторские задачи вместо скрейпинга PR, короткие промпты, проверка поведения, защита от контаминации

что из этого моё

Можно использовать подход DeepSWE для создания собственных оценочных задач: писать их с нуля, делать промпты краткими и реалистичными, а проверку строить на поведении, а не на деталях реализации. Это повысит качество оценки агентов и снизит риск контаминации.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать промпты в конвейере разборов, сократив их вдвое и убрав лишние инструкции
заблокировать доступ агента к git-истории при оценке его правок
настроить проверку решений по наблюдаемому поведению, а не по реализации
о чём говорят, по времени
главы доводят до 07:30 · дальше по ролику меток нет
01
Введение и мотивация00:00
Джеймс представляет DeepSWE и объясняет, почему существующие бенчмарки неэффективны.
02
Качественные наблюдения02:30
Анализ поведения разных моделей: Claude, GPT и другие.
03
Методология DeepSWE05:00
Как создаются задачи и почему они лучше.
04
Планы развития07:30
Что планируется улучшить в будущем.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы