Локальный запуск гигантских LLM: гибрид CPU+GPU и настройка batch size
Serverflow запустил три гигантские открытые модели (GLM 5.2, MiMo V2.5 Pro, Kimi K2.7) на одной машине с CPU+GPU, используя llama.cpp. Гибридный режим удваивает скорость генерации, а настройка batch size радикально ускоряет обработку промпта. Локальный инференс дорог в железе, но даёт контроль и свободу.
Serverflow запустил три гигантские открытые модели (GLM 5.2, MiMo V2.5 Pro, Kimi K2.7) на одной машине с CPU+GPU, используя llama.cpp. Гибридный режим удваивает скорость генерации, а настройка batch size радикально ускоряет обработку промпта. Локальный инференс дорог в железе, но даёт контроль и свободу.
Видео даёт конкретные параметры запуска больших моделей (кванты, batch size, гибрид CPU+GPU) и реальные цифры скорости, которые можно использовать для оценки целесообразности локального инференса в проектах оркестрации агентов. Особенно полезно для выбора конфигурации железа и настройки llama.cpp под задачи автоматизации.