Andon Labs создали benchmark для оценки AI-агентов на примере управления автоматом с напитками, чтобы понять, насколько агенты способны вести бизнес. Важна простота и нейтральность теста, а также кеширование промптов для эффективности. Это помогает измерять реальные денежные результаты агентов.
When AI Agents Run Businesses — Lukas Petersson and Axel Backlund of Andon Labs
полный разбор ролика · 5 глав ↓
Введение и контекст
В начале обсуждается природа AI и проблемы с его поведением, затем представляются гости — основатели Andon Labs, которые занимаются оценкой AI-агентов.
Подчёркивается важность подписчиков для поддержки контента и кратко рассказывается о целях выпуска.
История Andon Labs и Vending Bench
Основатели рассказывают, как они познакомились и решили создать компанию после университета.
Обсуждается идея создания простого бизнес-симулятора — автомата с напитками — для оценки AI-агентов в реальных условиях.
Подчеркивается, что изначально проект не получил большого внимания, но затем стал вирусным благодаря соцсетям.
Как начать сотрудничество с крупными лабораториями
Рассказано, что они сначала бесплатно предоставляли свои инструменты для использования, что привело к платному сотрудничеству.
Рекомендация — создавать полезные, уникальные evals, которые хорошо разделяют модели по качеству.
Отмечается, что проекты с реальной денежной мотивацией (например, заработок в долларах) ценятся выше.
Проблемы с насыщением и улучшения Vending Bench
Обсуждается, что многие evals насыщаются и перестают различать модели, но Vending Bench не был насыщен, а просто несовершенен.
Вторая версия Vending Bench улучшила harness, добавила кеширование промптов, что снизило затраты и повысило стабильность.
Подчеркивается важность минималистичного и нейтрального harness для справедливого сравнения моделей.
Философия создания harness
Выбирается простой, минималистичный harness без сложных подагентов, чтобы тестировать именно модель, а не вспомогательные инструменты.
Обсуждается баланс между оптимизацией harness под конкретную модель и универсальностью для всех.
Такой подход помогает объективно оценивать AI-агентов без искажений.