Expensive Model ≠ Smart Agent: The Brain Anatomy of a Senior AI Agent
Интеллект агента зависит не от дорогой модели, а от грамотного роутинга и управления контекстом. Используйте классификатор для выбора модели по запросу, учитывайте кэш и наблюдаемость. Выбор между RAG и длинным контекстом — баланс между сложностью, полнотой и стоимостью.
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение и проблема стоимости
Стоимость вызова фронтирмодели за один запрос может быть высокой, особенно при множественных итерациях и большом числе задач.
Ключ к снижению затрат — правильный выбор модели и управление контекстом, а не просто использование дорогой модели.
Роутинг моделей
Используйте классификатор, который по типу и сложности запроса решает, какую модель вызвать — дорогую или дешевую.
Это снижает стоимость более чем вдвое при сохранении 95% качества, а также позволяет использовать специализированные модели для повышения качества.
Проблемы с кэшем и наблюдаемостью
Переключение моделей может привести к потере кэша и повышению затрат, это нужно учитывать при роутинге.
Без наблюдаемости (метрик по стоимости, выбору модели и попаданию в кэш) роутинг неэффективен и непредсказуем.
Интеграция знаний: RAG vs длинный контекст
RAG — сложный, но экономичный подход с поиском релевантных фрагментов в базе и подстановкой в контекст.
Длинный контекст проще в реализации, но дороже и может страдать от эффекта "потерянного внимания" при больших объёмах данных.
Трейдофы и масштабируемость
RAG снижает шум и повышает точность, но требует сложной инфраструктуры и настройки.
Длинный контекст обеспечивает полноту данных, но дорого обходится и плохо масштабируется при больших объёмах знаний.