разбор · агентытема-фронтир · H 1.50
7.0
из 10
смотреть по главам — взять две-три нужные минуты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Продакшн AI-приложений: трассировка, оценка, наблюдаемость
Shipping complex AI applications — Braintrust & Trainline
Воркшоп Braintrust и Trainline о том, как переводить AI-приложения из демо в продакшн: через трассировку, оценку и наблюдаемость. Главный вывод — нужен системный подход с обратной связью (flywheel), а не просто промпты.
Чтобы шерить AI в проде: наблюдаемость, оценки, итеративный flywheel — иначе демо развалится.
что из этого моё
Можно применить как чек-лист для перехода от прототипа к продакшену: внедрить трассировку агентских вызовов, создать golden set для регрессионного тестирования, настроить мониторинг качества ответов. Особенно полезно для оркестрации мультиагентных систем и управления стоимостью моделей.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
разбить монолитный LLM-вызов на стадии: контекст, триаж, политика, ответ, финализация
создать golden set эталонных примеров и прогонять его при каждом изменении модели или промпта
настроить трассировку вызовов инструментов и токенов в своём конвейере разборов
о чём говорят, по времени
главы доводят до 30:00 · дальше по ролику меток нет
01
Вступление и контекст00:00 ↗
Представление спикеров и проблемы перехода от демо к продакшену.
02
Опыт Trainline06:00 ↗
Как Trainline использует AI и Braintrust для своего travel assistant.
03
Настройка воркшопа12:00 ↗
Инструкции по подготовке окружения: Slack, репозиторий, API-ключи.
04
Построение агента18:00 ↗
Создание простого агента с одним вызовом LLM, затем добавление инструментов и разбиение на стадии.
05
Трассировка и оценка30:00 ↗
Внедрение Braintrust для трассировки, создания golden set и оценки.