Evals для агентов: трейсы, код-evals и LLM-судьи
Лори Восс из Arize показывает, как тестировать AI-агентов через evals: сначала собирать трейсы (логи), затем анализировать их, чтобы понять, что сломано, и только потом писать код-evals и LLM-судьи. Главный вывод: evals — это тесты для агентов, они позволяют безопасно менять промпты и модели, а также превращать capability-тесты в регрессионные.
Эвалы — это тесты на логах: сначала смотри трассы, потом пиши код- и LLM-эвалы, чтобы безопасно менять промпты
Для оператора входа в AI это прямо применимо: evals — это способ проверять, что оркестрация моделей и автоматизация работают корректно. Можно внедрить трейсинг (например, Phoenix) для сбора логов всех вызовов, затем писать код-evals для проверки форматов ответов и LLM-судей для оценки смысла. Это позволит безопасно менять промпты и модели, не боясь регрессий.