← Материалы разборы Yersham
разбор · агентыбалл 7.0#355 из 823 · 2026-06-25

Andon Labs создали benchmark для оценки AI-агентов на примере управления автоматом с напитками, чтобы понять, насколько агенты способны вести бизнес. Важна простота и нейтральность теста, а также кеширование промптов для эффективности. Это помогает измерять реальные денежные результаты агентов.

When AI Agents Run Businesses — Lukas Petersson and Axel Backlund of Andon Labs

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Для оператора входа в AI важно строить простые, прозрачные тесты и оркестрацию агентов с кешированием и минималистичным интерфейсом, чтобы оценивать и оптимизировать бизнес-ориентированные AI-сценарии и демонстрировать их эффективность.

полный разбор ролика · 5 глав
01

Введение и контекст

В начале обсуждается природа AI и проблемы с его поведением, затем представляются гости — основатели Andon Labs, которые занимаются оценкой AI-агентов.

Подчёркивается важность подписчиков для поддержки контента и кратко рассказывается о целях выпуска.

02

История Andon Labs и Vending Bench

Основатели рассказывают, как они познакомились и решили создать компанию после университета.

Обсуждается идея создания простого бизнес-симулятора — автомата с напитками — для оценки AI-агентов в реальных условиях.

Подчеркивается, что изначально проект не получил большого внимания, но затем стал вирусным благодаря соцсетям.

03

Как начать сотрудничество с крупными лабораториями

Рассказано, что они сначала бесплатно предоставляли свои инструменты для использования, что привело к платному сотрудничеству.

Рекомендация — создавать полезные, уникальные evals, которые хорошо разделяют модели по качеству.

Отмечается, что проекты с реальной денежной мотивацией (например, заработок в долларах) ценятся выше.

04

Проблемы с насыщением и улучшения Vending Bench

Обсуждается, что многие evals насыщаются и перестают различать модели, но Vending Bench не был насыщен, а просто несовершенен.

Вторая версия Vending Bench улучшила harness, добавила кеширование промптов, что снизило затраты и повысило стабильность.

Подчеркивается важность минималистичного и нейтрального harness для справедливого сравнения моделей.

05

Философия создания harness

Выбирается простой, минималистичный harness без сложных подагентов, чтобы тестировать именно модель, а не вспомогательные инструменты.

Обсуждается баланс между оптимизацией harness под конкретную модель и универсальностью для всех.

Такой подход помогает объективно оценивать AI-агентов без искажений.

#агенты#оркестрация#evals#автоматизация
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы