разбор · rl
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
CUDA Agent: RL-генерация GPU-ядер обходит Torch и коммерческие модели
Исследователи из ByteDance и Университета Цинхуа создали CUDA Agent, который с помощью RL генерирует GPU-ядра, превосходящие Torch и коммерческие модели. Ключ — синтез данных, защита от читерства и многоступенчатый разогрев обучения.
CUDA Agent через RL и синтез данных научился писать ядра лучше коммерческих моделей и компиляторов, обходя их
что из этого моё
Прямой связи с моей работой нет: видео о генерации низкоуровневого кода для GPU, что не относится к оркестрации моделей или автоматизации входа в AI. Однако подходы к синтезу данных, защите от reward hacking и разогреву RL могут быть адаптированы для обучения агентов в других узких доменах.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
вынести правило фильтрации синтетических данных по компилируемости и детерминизму в конвейер разборов
настроить дискретные награды за пороги производительности в своём RL-агенте
применить многоступенчатый разогрев RL: rejection finetuning и value pretraining
о чём говорят, по времени
главы доводят до 10:00 · дальше по ролику меток нет
01
Введение и проблема00:00 ↗
Почему написание CUDA-ядер сложно и как LLM не справляются.
02
Синтез данных02:30 ↗
Создание датасета KUDA Agent 6K из 6000 задач.
03
Среда и защита05:00 ↗
Рабочее пространство агента и защита от читерства.
04
Коллапс и разогрев07:30 ↗
Провал обучения и многоступенчатый разогрев.
05
Результаты и стратегии10:00 ↗
Победа над Torch и коммерческими моделями, паттерны оптимизации.