разбор · маршрутизация
7.0
из 10
смотреть по главам — взять две-три нужные минуты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
ML-роутер сокращает расходы на ИИ до 85%
Маршрутизация запросов между дорогими и дешёвыми моделями: ML-роутер отправляет к флагману лишь 14-26% запросов, сохраняя 95% качества и срезая расходы до 85%, а в длинных сессиях агентов переключение моделей без учёта кэша контекста съедает всю экономию.
Маршрутизация моделей экономит до 85% бюджета, но требует учета кэша и независимости от вендоров.
что из этого моё
Экономию на дешёвой модели проверять с учётом кэша: в длинной сессии агента переключение моделей сбрасывает кэш контекста и съедает всю выгоду, поэтому дешёвую модель ставить на отдельные короткие задачи, а не в середину диалога. Ориентир масштаба из ролика — флагманы дороже компактных в 14-25 раз, а ML-роутер отправляет к сильной модели лишь 14-26% запросов, сохраняя 95% качества.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
вынести маршрутизацию запросов между моделями в отдельный сервис с ML-роутером
замерить экономию от дешёвой модели с учётом сброса кэша контекста в длинных сессиях
настроить переключение на дешёвую модель только для коротких задач
о чём говорят, по времени
главы доводят до 05:16 · дальше по ролику меток нет
01
Проблема расходов00:02 ↗
Огромные расходы на ИИ из-за неэффективного использования.
02
Непредсказуемость расходов01:05 ↗
Бюджеты на ИИ растут из-за непредсказуемости и быстрорастущего использования.
03
Снижение расходов на ИИ02:10 ↗
Способы сократить расходы на ИИ до 85%.
04
Роутер vs Шлюз04:14 ↗
Разграничение роли шлюза и роутера в маршрутизации запросов.
05
Ценообразование моделей05:16 ↗
Разница в стоимости использования сильных и слабых моделей.