В работе показано, что глубокие (до 1000 слоев) нейросети с архитектурными улучшениями (residual connections и др.) и новым self-supervised RL-объективом позволяют масштабировать обучение в reinforcement learning, обходя ограничения классического RL с наградами. Ключ — не просто глубина, а комплекс архитектур и смена цели обучения.
[NeurIPS Best Paper] 1000 Layer Networks for Self-Supervised RL — Kevin Wang et al, Princeton
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение и контекст
Проект начался как исследовательский семинар, где студенты из Принстона решили проверить возможность масштабирования RL с помощью глубоких сетей.
Идея возникла из наблюдения, что в RL традиционно используют очень мелкие сети, в отличие от NLP и vision, где масштабирование дало прорывы.
Проблема и гипотеза
Традиционный RL плохо масштабируется, особенно value-based методы, поэтому выбрали self-supervised RL — обучение представлений без наград.
Первоначальные попытки увеличить глубину ухудшали результаты, но добавление residual connections и других архитектурных компонентов резко улучшило производительность.
Эксперименты по масштабированию
Масштабирование глубины без архитектурных улучшений ухудшало результаты, а с residual connections и другими трюками — резко улучшало.
Глубина с улучшениями оказалась более параметро- и выборочно-эффективной, чем просто увеличение ширины.
Архитектурные решения
Residual connections предотвращают затухание градиентов и критичны для успеха глубоких RL-сетей.
Эксперименты без них показали значительное падение качества, что подтверждает необходимость архитектурных новшеств.
Выводы и перспективы
Главный вывод — масштабирование RL требует не только больших сетей, но и смены цели обучения на self-supervised, без прямого максимизирования наград.
Граница между RL, supervised и unsupervised learning размыта, и будущее за гибридными подходами.