Инфраструктура для малых моделей: горячая замена и предобработка
Доклад о создании open-source инфраструктуры для инференса малых моделей (Superlinked inference engine). Ключевая идея: для эффективной работы агентов нужно управлять контекстом с помощью малых моделей, а инференс — это не просто GPU, а сочетание поддержки моделей и инфраструктуры (роутинг, автоскейлинг, горячая замена моделей).
Малые модели решают контекстную гниль, но требуют адаптации архитектур и инфраструктуры: Sie даёт готовое…
Можно применить для оркестрации агентов: использовать малые модели для предобработки контекста (фильтрация, извлечение сущностей) и для tool calling, что снижает токены и улучшает качество. Также взять на вооружение подход с горячей заменой моделей на GPU для экономии ресурсов при запуске множества мелких моделей.