← Материалы разборы Yersham
разбор · телеграм
3.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

ИИ-агенты решают лишь 41% задач в новом тесте на рефакторинг

Новый бенчмарк для ИИ-агентов кода показывает 41% успеха на сложных рефакторингах, обнажая завышенные оценки старых тестов.

Новый бенчмарк для ИИ-агентов кода показывает 41% успеха на сложных рефакторингах, обнажая завышенные оценки старых тестов.

что из этого моё

Можно использовать выводы для настройки оркестрации: не доверять агентам полностью в сложных рефакторингах, внедрять автоматические проверки на регрессии и использовать новые бенчмарки для выбора моделей. Также полезно для контента — писать обзоры с реальными цифрами, чтобы привлекать аудиторию.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
прогнать свой конвейер разборов на новом бенчмарке для оценки агентов кода
настроить автоматическую проверку регрессий в CI для изменений, вносимых агентами
расшифровка ролика ↓

ИИ-агенты для генерации кода решили лишь 41% задач в новом тесте

ИИ-агенты хорошо пишут код, но с по-настоящему сложными задачами всё ещё справляются не так хорошо.

Исследователи предлагают новый способ проверять такие системы: не на коротких починках, а на больших переделках кода, где нужно аккуратно менять сразу много частей и ничего не ломать. Команда специально отобрала реальные задачи, переписала их описания ясным языком и вручную проверила проверки, чтобы те не отсеивали верные ответы и не требовали того, чего не было в условии.

В этом обзоре разбираем, почему старые способы оценки ИИ для кода дают слишком красивую картину и что показывает новая проверка о реальных возможностях таких агентов.

📜 Полный обзор

дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
ещё разборы