Основной инсайт — переход от имитационного обучения к on-policy RL, когда модель учится на собственных ошибках и генерациях, а не копирует чужие. Важно быстро обновлять свои модели мира при появлении новых данных и не бояться менять подходы.
Captaining IMO Gold, Deep Think, On-Policy RL, Feeling the AGI in Singapore — Yi Tay
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение и контекст
Спикер делится ощущением прогресса AI в разных сферах, включая кодинг и генерацию изображений.
Рассказывает о возвращении в Google и изменениях в инфраструктуре, подчеркивая плавность адаптации.
Переход к исследованию RL
Он объясняет, что переключился с архитектур и предобучения на RL, видя в нем основной инструмент моделирования.
Подчеркивает универсальность исследовательских навыков и легкость адаптации к новым инструментам.
On-policy vs off-policy RL
On-policy — обучение на собственных генерациях модели с последующей оценкой и корректировкой.
Off-policy — обучение на данных, сгенерированных другими моделями или из внешних источников.
Спикер приводит аналогии с человеческим обучением, подчеркивая важность самостоятельного опыта.
Переход от имитации к самостоятельному обучению
Имитация полезна на начальных этапах, но для прогресса требуется самостоятельный поиск и получение обратной связи.
Человеческое обучение аналогично — сначала копирование, затем самостоятельная практика.
Подчеркивается важность безопасной среды для экспериментов и ошибок.
Обновление моделей мира и скорость обучения
Спикер советует при появлении контрпримеров резко менять свои модели, а не делать минимальные корректировки.
Приводит пример с генеративными моделями и резким изменением восприятия после появления stable diffusion.
Рекомендует планировать «фазы обучения» с учетом изменения парадигм.