разбор · reinforcement learning
1.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Глубокие сети до 1000 слоев для self-supervised RL
[NeurIPS Best Paper] 1000 Layer Networks for Self-Supervised RL — Kevin Wang et al, Princeton
В работе показано, что глубокие (до 1000 слоев) нейросети с архитектурными улучшениями (residual connections и др.) и новым self-supervised RL-объективом позволяют масштабировать обучение в reinforcement learning, обходя ограничения классического RL с наградами. Ключ — не просто глубина, а комплекс архитектур и смена цели обучения.
Масштабирование RL требует смены objective на self-supervised и архитектурных трюков; глубина эффективнее шири
что из этого моё
Можно внедрить архитектурные паттерны (residual connections) и self-supervised RL-объективы в оркестрацию агентов и автоматизацию обучения, улучшая масштабируемость и стабильность моделей, а также создавать более эффективные пайплайны без зависимости от наград.
Тезисы ролика
применимого к своей работе линза здесь не нашла
▸Использовать residual connections и другие архитектурные трюки для стабилизации очень глубоких сетей в RL.
▸Применять self-supervised RL-объективы, которые не зависят от наград, а учатся представлениям состояний и действий.
▸Комбинировать масштабирование по глубине с изменением архитектуры и цели, а не просто увеличивать параметры.
▸Переосмыслить RL как задачу классификации будущих состояний по траектории, а не регрессию на награды.
о чём говорят, по времени
главы доводят до 08:19 · дальше по ролику меток нет
01
Введение и контекст00:02 ↗
Знакомство с авторами и общая идея проекта.
02
Проблема и гипотеза02:05 ↗
Почему глубокие сети в RL не работают и что попробовать.
03
Эксперименты по масштабированию05:44 ↗
Как масштабировали глубину, ширину и batch size.
04
Архитектурные решения07:19 ↗
Почему residual connections важны и как они влияют.
05
Выводы и перспективы08:19 ↗
Главные инсайты и дальнейшие направления.