разбор · бенчмарки
3.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Fullstack-Bench: сильные абстракции и процедурный код повышают успех агентов
Fullstack-Bench: The Eval for Coding Agents — with Sujay Jayakar, Chief Scientist, Convex
Convex построил Fullstack-Bench для оценки AI-кодинга на реальных задачах: чат, todo, файлы. Выяснилось, что модели сильно зависят от бэкенда: с Convex справляются почти автономно, с Supabase и FastAPI+Redis — застревают. Главные выводы: сильные абстракции и процедурный код помогают моделям, а нестандартные API и декларативные правила (RLS) — мешают.
Fullstack-Bench: Convex выигрывает у Supabase и FastAPI, но оценка требует ручного труда и выявляет, как AI ме
что из этого моё
Можно применить для оркестрации агентов: использовать выводы о том, что сильные абстракции и процедурный код повышают успешность агентов, и проектировать свои инструменты/API с учётом этого. Также идея бенчмарка с фокусом на конкретный навык применима для оценки собственных агентов.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
вынести в cursor rules специфику своего API и замерить длину инструкций
автоматизировать проверку результата агента через тесты или линтеры
спроектировать API в процедурном стиле вместо декларативных правил
о чём говорят, по времени
главы доводят до 18:00 · дальше по ролику меток нет
01
Введение и мотивация00:00 ↗
Convex создаёт бенчмарк для оценки AI-кодинга на своём бэкенде.
02
Дизайн бенчмарка02:30 ↗
Три задачи (чат, todo, файлы) и три бэкенда, старт с готового фронтенда.
03
Результаты и наблюдения06:00 ↗
Convex показал лучшие результаты, модели застревали на Supabase и FastAPI.
04
Влияние на дизайн Convex12:00 ↗
AI-кодинг заставляет пересматривать API, чтобы уменьшить галлюцинации.
05
Будущее и выводы18:00 ↗
Планы по автоматизации оценки и общие принципы для разработчиков.