разбор · агентытема-фронтир · H 1.51
4.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Эвалы переходят от LLM-as-judge к Agent-as-judge
The Future of Evals: From LLM as a Judge to Agent as a Judge — Aparna Dhinakaran, Arize AI
Эвалы эволюционируют от LLM-as-judge к Agent-as-judge для оценки сложных агентных систем. Arize AI запустила Signal — агента, который анализирует трассировки, находит паттерны сбоев и даже предлагает исправления. Ключевой вывод: для адаптивных агентов нужны адаптивные эвалы.
Агенты сложнее — классические оценки не справляются. Нужен агент как судья: он видит динамику, находит сбои и…
что из этого моё
Для оператора входа в AI это прямое руководство: при построении оркестрации агентов внедрять агентные эвалы для мониторинга живых трассировок, чтобы автоматически выявлять и исправлять сбои в реальном времени. Это повысит надёжность и снизит ручную работу.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
настроить онлайн-эвалы на живых трассировках своего конвейера разборов
добавить агентный эвал для обнаружения зацикливаний и потери контекста в своих агентах
настроить автоматическое создание PR с фиксом от агентного эвала
о чём говорят, по времени
главы доводят до 06:00 · дальше по ролику меток нет
01
Введение и статистика00:00 ↗
Ариза проводит 100M+ эвалов в месяц, команды запускают до 3800+ эвалов.
02
Проблема сложности агентов01:30 ↗
Сложность агентов выросла: tool calls, reasoning, sub-agents, длинные задачи.
03
Кейс с агентом Alex03:00 ↗
Собственный агент Arize показал новые типы сбоев: забывание контекста, циклы.
04
Решение: Agent-as-judge04:30 ↗
Представлен Signal — агент для анализа трасс и поиска паттернов проблем.
05
Приглашение и итоги06:00 ↗
Ариза приглашает на стенд и ивенты, подчеркивает будущее эвалов.