Обзор запуска LLM на NPU-ускорителе Huawei Atlas 300I Duo 96GB: квантизация моделей Qwen3-32B и Qwen3-30B-A3B (MoE) чер…
Обзор запуска LLM на NPU-ускорителе Huawei Atlas 300I Duo 96GB: квантизация моделей Qwen3-32B и Qwen3-30B-A3B (MoE) через MindIE и MsModelSlim. Показаны скорости: 8.5 ток/с для dense, 30 ток/с для MoE. Главный вывод: ускоритель эффективен для MoE-моделей, но требует ручной квантизации и специфического стека.
Обзор запуска LLM на NPU-ускорителе Huawei Atlas 300I Duo 96GB: квантизация моделей Qwen3-32B и Qwen3-30B-A3B (MoE) через MindIE и MsModelSlim. Показаны скорости: 8.5 ток/с для dense, 30 ток/с для MoE. Главный вывод: ускоритель эффективен для MoE-моделей, но требует ручной квантизации и специфического стека.
Прямой пользы для оркестрации и автоматизации нет, но есть референс по запуску LLM на NPU: можно использовать Atlas 300 как дешёвый инференс-сервер для MoE-моделей, если нужна автономная площадка без Nvidia. Для оператора входа в AI это скорее фон: если клиенты спрашивают про альтернативы GPU, можно ссылаться на этот опыт.