разбор · aiтема в работе · H 1.30
1.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
TurboQuant: сжатие KV-кэша в 6-10 раз и ускорение в 8 раз
TurboQuant: The Future of Independent and Managed AI Memory
Алгоритм Turboant от Google решает кризис вычислительной памяти в AI, сжимая KV-кэш и рабочую память языковых моделей в 6-10 раз без потери данных и ускоряя работу чипа в 8 раз. Это может радикально изменить бизнес-ландшафт, снизив затраты на модели и сделав векторные базы данных ненужными.
TurboQuant сжимает память ИИ в 6-10 раз, но внедрение упирается в firmware. Пять методов оптимизации вместе да
что из этого моё
Прямой связи с текущими задачами нет: сжатие кэша внимания происходит внутри чипа, повлиять на него со стороны нельзя. Забирается одна цифра для сметы — агент, который сам планирует и гоняет код по кругу, сжигает от ста миллионов до миллиарда токенов за один присест.
Тезисы ролика
применимого к своей работе линза здесь не нашла
▸Используйте полярную систему координат для кодирования векторов, где радиус обозначает силу сигнала, а угол - смысл слова.
▸Компенсация ошибок округления с помощью корректирующего бита снижает погрешность в оценках внимания до нуля.
▸Тесты показывают, что алгоритм справляется с задачами поиска и кодирования без потери точности.
▸Физические аппаратные ограничения GPU и необходимость переписывания драйверов и операционных систем могут снизить эффективность алгоритма в реальных условиях.
о чём говорят, по времени
главы доводят до 08:20 · дальше по ролику меток нет
01
Вступление00:01 ↗
Обсуждение проблемы аппаратных ограничений в AI.
02
Метапхорка памяти01:03 ↗
Анализ дефицита памяти и ее последствий.
03
Решение Turboant03:06 ↗
Описание алгоритма Turboant и его преимуществ.
04
Тестирование и результаты06:12 ↗
Исходы тестирования Turboant на реальных задачах.
05
Внутренние вычисления и будущее08:20 ↗
Интеграция интерпретатора WebAssembly и его влияние на ИИ.