← Материалы разборы Yersham
разбор · huawei
5.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Обзор запуска LLM на NPU-ускорителе Huawei Atlas 300I Duo 96GB: квантизация моделей Qwen3-32B и Qwen3-30B-A3B (MoE) чер…

Huawei Atlas 300i Duo 96GB for LLMs — Running and Quantizing Qwen3-30B-A3B Q8

Обзор запуска LLM на NPU-ускорителе Huawei Atlas 300I Duo 96GB: квантизация моделей Qwen3-32B и Qwen3-30B-A3B (MoE) через MindIE и MsModelSlim. Показаны скорости: 8.5 ток/с для dense, 30 ток/с для MoE. Главный вывод: ускоритель эффективен для MoE-моделей, но требует ручной квантизации и специфического стека.

Обзор запуска LLM на NPU-ускорителе Huawei Atlas 300I Duo 96GB: квантизация моделей Qwen3-32B и Qwen3-30B-A3B (MoE) через MindIE и MsModelSlim. Показаны скорости: 8.5 ток/с для dense, 30 ток/с для MoE. Главный вывод: ускоритель эффективен для MoE-моделей, но требует ручной квантизации и специфического стека.

что из этого моё

Прямой пользы для оркестрации и автоматизации нет, но есть референс по запуску LLM на NPU: можно использовать Atlas 300 как дешёвый инференс-сервер для MoE-моделей, если нужна автономная площадка без Nvidia. Для оператора входа в AI это скорее фон: если клиенты спрашивают про альтернативы GPU, можно ссылаться на этот опыт.

Тезисы ролика
применимого к своей работе линза здесь не нашла
Для квантизации на Atlas 300 используйте MsModelSlim: сначала V8A8 (17 мин), затем V8A8_SC (21 мин) — суммарно ~40 мин на Qwen3-32B.
MoE-модели (Qwen3-30B-A3B) квантизуются отдельным скриптом, который нужно дорабатывать — готовый из репозитория не работает.
Запускайте инференс через MindIE в Docker-контейнере, пробрасывая NPU-чипы и драйверы.
Для MoE-моделей активируется только часть экспертов, поэтому нагрузка на чипы ~50-55%, а скорость выше: 30 ток/с против 8.5 у dense.
о чём говорят, по времени
главы доводят до 07:24 · дальше по ролику меток нет
01
Введение и характеристики00:00
Обзор Atlas 300I Duo: 96GB, 280 TOPS INT8, пассивное охлаждение.
02
Установка драйверов и MindIE01:01
Установка драйверов и MindIE для запуска инференса.
03
Типы квантизации03:07
Объяснение форматов квантизации: W8A8, W8A8_SC, W16A16C, W8A16, W4A8.
04
Квантизация Qwen3-32B04:43
Практический процесс квантизации dense-модели в W8A8 и W8A8_SC.
05
Квантизация MoE и запуск07:24
Квантизация Qwen3-30B-A3B (MoE) и запуск через MindIE.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
ещё разборы