← Материалы разборы Yersham
разбор · cudaбалл 8.0#38 из 438 · 2026-06-25

Macorix автоматизирует генерацию высокопроизводительных CUDA-ядр и оптимизирует системный уровень, включая inference-серверы, с помощью новых алгоритмов, например, sequential Monte Carlo speculative decoding, который ускоряет генерацию токенов без откатов. Важна жёсткая eval-пайплайн для предотвращения reward hacking.

How Makora Generates CUDA Kernels That Beat Hand-Tuned Code | Researcher Conversations at GTC

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Оператору входа в AI полезно использовать идеи автоматической генерации и оптимизации ядров с жёсткой проверкой качества, а также применять методы ускоренного инференса (SMC speculative decoding) для оркестрации и автоматизации inference pipeline.

полный разбор ролика · 5 глав
01

Введение и цель Macorix

Macorix фокусируется на автоматизации инженерии производительности AI, начиная с генерации высокопроизводительных GPU-ядр и расширяясь до системных оптимизаций inference и обучения.

Основная идея — заменить ручную работу инженеров автоматическими алгоритмами, чтобы повысить эффективность и скорость работы AI-систем.

02

Sequential Monte Carlo speculative decoding

Вместо отката при несовпадении токенов метод держит несколько черновиков, оценивает их с помощью целевой модели и отбирает лучшие, что позволяет всегда принимать токены и ускоряет инференс.

Этот метод даёт в 2-5 раз большую скорость по сравнению с традиционным speculative decoding, особенно в режиме низкой задержки и малого батча.

03

Особенности и ограничения метода

Метод является lossy, что может не подойти для задач с жёсткими требованиями к точности, но иногда даже превосходит целевую модель за счёт вариативности.

SMC совместим с разными моделями и токенизациями, что даёт гибкость в применении, но требует дальнейших исследований.

04

Проблемы с бенчмаркингом и reward hacking

Macorix внедрил многоступенчатый eval-пайплайн с трассировкой вызовов, AI-детекцией reward hacking и ограничением использования библиотек для предотвращения читинга.

Этот пайплайн уже продаётся клиентам как сервис для обучения foundation моделей, что подтверждает его эффективность и надёжность.

05

Интеграция и продуктовые решения

Используется API, который клиенты могут применять для оценки своих ядер и получения сигналов качества для обучения.

Компания работает над собственным inference engine для реализации сложных оптимизаций, поскольку существующие open source решения имеют ограничения.

#cuda#оптимизация#инференс#автоматизация
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы