разбор · llmтема-фронтир · H 1.53
4.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
NVFP4-квантование ускоряет LLM в 2.4 раза на DGX Spark
Running LLMs locally: Practical LLM Performance on DGX Spark — Mozhgan Kabiri chimeh, NVIDIA
NVIDIA DGX Spark (GB10) позволяет локально запускать LLM до 200B параметров. Квантование NVFP4 критично: 14B модель даёт 20 ток/с и TTFT в 3.4 раза быстрее, чем без квантования. Главный вывод: для локальной разработки и прототипирования это рабочий инструмент, но пропускная способность памяти — узкое место.
DGX Spark с NVFB4-квантованием даёт 20 tok/s на 14B модели, обеспечивая локальную разработку без потери произв
что из этого моё
Для оператора входа в AI: подход с NVFP4-квантованием и vLLM можно применить для локального тестирования агентов и оркестрации моделей до 200B параметров, не тратя облачные ресурсы. Методика бенчмарков (Docker, прогрев, метрики) — готовая схема для оценки моделей в своих пайплайнах. TTFT как метрика UX — прямо в работу.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
замерить TTFT и throughput своей 14B модели с NVFP4-квантованием на DGX Spark
запустить vLLM в NVIDIA-контейнере для локального тестирования агентов
внедрить методику бенчмарков: Docker-изоляция, 3 прогрев-прогона, фоновый сбор метрик GPU
о чём говорят, по времени
главы доводят до 07:00 · дальше по ролику меток нет
01
Введение и проблемы00:00 ↗
Проблемы: нехватка памяти, софт-стек, облачные задержки.
02
DGX Spark и GB1001:30 ↗
GB10: 128GB unified memory, до 200B параметров, тот же софт-стек.
03
Методика бенчмарков03:00 ↗
Автоматический харнесс: Docker, прогрев, метрики.
04
Результаты throughput05:00 ↗
1.5B: 61.7 ток/с, 14B NVFP4: 20.2 ток/с, 14B base: 8.4 ток/с.
05
TTFT и выводы07:00 ↗
NVFP4 ускоряет TTFT в 3.4 раза. Память ≠ bandwidth.