разбор · eval
7.0
из 10
смотреть по главам — взять две-три нужные минуты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Оценка AI-продуктов: LLM-as-judge с текстовыми метками и A/B-тесты промптов
Shipping AI That Works: An Evaluation Framework for PMs – Aman Khan, Arize
Aman Khan из Arize показывает, как PM может системно подходить к оценке AI-продуктов: от трассировки агентов до прогона A/B-тестов промптов на датасетах. Главное — перейти от vibe coding к thrive coding, используя данные для уверенности в релизах.
Оценка AI через LLM-судью, трейсы и A/B-эксперименты на датасетах — ключ к надежному продакшену.
что из этого моё
Для оператора входа в AI это прямо применимо: оркестрация агентов требует системной оценки. Можно внедрить трейсинг и eval'ы для проверки качества ответов, A/B-тестировать промпты на реальных данных, чтобы повысить надёжность автоматизации. Конкретно: использовать LLM-as-judge с текстовыми метками, строить датасеты из логов, визуализировать пайплайны.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать eval-скрипт на текстовые метки good/bad вместо числовых оценок
собрать датасет из логов продакшн-трасс и прогнать A/B-тест промптов на всем датасете
настроить визуализацию спанов в трассировке агента для поиска узких мест
о чём говорят, по времени
главы доводят до 28:00 · дальше по ролику меток нет
01
Введение и контекст00:00 ↗
Аман представляет себя и тему: оценка AI-продуктов для PM.
02
Что такое eval05:00 ↗
Объяснение eval как аналога тестирования, но с учётом недетерминированности LLM.
03
Демо: AI trip planner12:00 ↗
Создание агентной системы для планирования путешествий с использованием LangGraph.
04
Трассировка и визуализация20:00 ↗
Использование Arize/Phoenix для просмотра трасс и спанов агента.
05
Промпт-плейграунд и A/B-тест28:00 ↗
Итерация промптов в плейграунде и запуск эксперимента на датасете.