← Материалы разборы Yersham
разбор · оркестрациятема-фронтир · H 1.49
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

KV-кэш и Paged Attention: память видеокарты как узкое место

Разбор того, почему система на языковой модели летает на демонстрации одному человеку и захлёбывается на сотне пользователей. Причина не в самой модели, а в работе с памятью видеокарты во время генерации: промежуточные вычисления приходится хранить, и место под них резервируется с огромным запасом. Решение взято из старых операционных систем — память нарезается на мелкие страницы и выдаётся по мере надобности, за счёт чего заполненность растёт почти до предела и покупать новое железо не нужно.

Инференс LLM упирается в память: KV-кэш и Paged Attention решают фрагментацию, но требуют настройки под нагруз

что из этого моё

Прямо переносится на сдачу работы: проверять бота не одним запросом от себя, а несколькими одновременными, иначе на демонстрации всё быстро, а в первый же наплыв клиентов заказчик увидит зависания. Если бот у заказчика будет тормозить, сначала смотреть на настройки обслуживания запросов, а не соглашаться на более дорогой тариф.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
проверить бота несколькими одновременными запросами перед сдачей
при тормозах бота смотреть настройки обслуживания запросов
о чём говорят, по времени
главы доводят до 07:26 · дальше по ролику меток нет
01
Вступление00:05
Объяснение проблемы масштабирования AI-систем.
02
Технологии KV кэширования и Page Detention01:10
Введение в KV кэширование и Paged Attention.
03
Фазы обработки запроса02:15
Разделение обработки запроса на прифил и декод.
04
Кэширование QKV04:22
Объяснение принципа работы KV-кэша.
05
Paged Attention07:26
Описание Paged Attention и его преимуществ.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы