LLM-D: распределённый инференс LLM на Kubernetes с ростом пропускной способности до 5 раз
LLM-D — open-source проект для распределённого инференса LLM на Kubernetes, официально в CNCF. Решает проблему масштабирования и оркестрации: интеллектуальная маршрутизация, обмен KV-кэшем, раздельное обслуживание. Бенчмарки показывают рост пропускной способности до 3-5 раз, снижение TTFT на 40-60%. Зрелость неполная (API до 1.0), но уже применимо для высоконагруженных сценариев.
LLM-D — открытая оркестрация для кластерного инференса: до 3-5x ускорение, но API нестабилен и есть риски.
Для оператора входа в AI это готовый инструмент для оркестрации LLM-инференса в Kubernetes: позволяет масштабировать модели под нагрузку, снижать задержки и оптимизировать затраты на GPU. Можно использовать как основу для автоматизации и агентов, где нужна высокая производительность и отказоустойчивость.