ИИ-агенты решают лишь 41% задач в новом тесте на рефакторинг
Новый бенчмарк для ИИ-агентов кода показывает 41% успеха на сложных рефакторингах, обнажая завышенные оценки старых тестов.
Новый бенчмарк для ИИ-агентов кода показывает 41% успеха на сложных рефакторингах, обнажая завышенные оценки старых тестов.
Можно использовать выводы для настройки оркестрации: не доверять агентам полностью в сложных рефакторингах, внедрять автоматические проверки на регрессии и использовать новые бенчмарки для выбора моделей. Также полезно для контента — писать обзоры с реальными цифрами, чтобы привлекать аудиторию.
расшифровка ролика ↓
ИИ-агенты для генерации кода решили лишь 41% задач в новом тесте
ИИ-агенты хорошо пишут код, но с по-настоящему сложными задачами всё ещё справляются не так хорошо.
Исследователи предлагают новый способ проверять такие системы: не на коротких починках, а на больших переделках кода, где нужно аккуратно менять сразу много частей и ничего не ломать. Команда специально отобрала реальные задачи, переписала их описания ясным языком и вручную проверила проверки, чтобы те не отсеивали верные ответы и не требовали того, чего не было в условии.
В этом обзоре разбираем, почему старые способы оценки ИИ для кода дают слишком красивую картину и что показывает новая проверка о реальных возможностях таких агентов.
📜 Полный обзор