Positron AI выбрал LPDDR вместо HBM для следующего поколения чипов, чтобы обеспечить в 6-8 раз большую память при меньшем энергопотреблении и упростить поставки. Архитектура оптимизирована под матрично-векторные операции для высокой пропускной способности и снижения стоимости токенов при высокой скорости.
Why Positron AI is Choosing LPDDR over HBM for Next-Gen LLM | Researcher Conversations at GTC
полный разбор ролика · 5 глав ↓
Введение и статус Positron
Positron за три года прошла путь от прототипа на FPGA до коммерческого продукта с поддержкой API и бенчмарков.
Быстрая итерация с клиентами позволила обойти более крупные компании с большим финансированием.
Ценообразование и производительность токенов
Positron стремится снизить стоимость токенов при сохранении высокой скорости и качества.
Высокая цена за скорость не всегда оправдана, пользователи привыкают к быстрой отдаче, но это не всегда нужно.
Архитектурные особенности чипа
Чип построен на systolic array с упором на максимальное использование пропускной способности памяти (~93% от теоретической).
В отличие от GPU, Positron оптимизирует матрично-векторные операции, ключевые для attention, что повышает эффективность.
Выбор LPDDR вместо HBM
LPDDR позволяет увеличить объем памяти в 6-8 раз при меньшем энергопотреблении (~400 Вт) по сравнению с HBM.
Большая память критична для поддержки моделей с триллионами параметров и длинного контекста.
Использование обычных органических подложек упрощает цепочку поставок и масштабирование.
Масштабирование и цели
Система Titan с четырьмя чипами Osmo рассчитана на 16 триллионов параметров и миллионы токенов контекста.
Высокая пропускная способность памяти и эффективная сетевая коммуникация между чипами позволяют снизить зависимость от межчипового обмена.