← Материалы разборы Yersham
разбор · маршрутизация
7.0
из 10
смотреть по главам — взять две-три нужные минуты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

ML-роутер сокращает расходы на ИИ до 85%

Маршрутизация запросов между дорогими и дешёвыми моделями: ML-роутер отправляет к флагману лишь 14-26% запросов, сохраняя 95% качества и срезая расходы до 85%, а в длинных сессиях агентов переключение моделей без учёта кэша контекста съедает всю экономию.

Маршрутизация моделей экономит до 85% бюджета, но требует учета кэша и независимости от вендоров.

что из этого моё

Экономию на дешёвой модели проверять с учётом кэша: в длинной сессии агента переключение моделей сбрасывает кэш контекста и съедает всю выгоду, поэтому дешёвую модель ставить на отдельные короткие задачи, а не в середину диалога. Ориентир масштаба из ролика — флагманы дороже компактных в 14-25 раз, а ML-роутер отправляет к сильной модели лишь 14-26% запросов, сохраняя 95% качества.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
вынести маршрутизацию запросов между моделями в отдельный сервис с ML-роутером
замерить экономию от дешёвой модели с учётом сброса кэша контекста в длинных сессиях
настроить переключение на дешёвую модель только для коротких задач
о чём говорят, по времени
главы доводят до 05:16 · дальше по ролику меток нет
01
Проблема расходов00:02
Огромные расходы на ИИ из-за неэффективного использования.
02
Непредсказуемость расходов01:05
Бюджеты на ИИ растут из-за непредсказуемости и быстрорастущего использования.
03
Снижение расходов на ИИ02:10
Способы сократить расходы на ИИ до 85%.
04
Роутер vs Шлюз04:14
Разграничение роли шлюза и роутера в маршрутизации запросов.
05
Ценообразование моделей05:16
Разница в стоимости использования сильных и слабых моделей.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы