разбор · rl
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
On-policy RL: обучение на собственных ошибках
Captaining IMO Gold, Deep Think, On-Policy RL, Feeling the AGI in Singapore — Yi Tay
Основной инсайт — переход от имитационного обучения к on-policy RL, когда модель учится на собственных ошибках и генерациях, а не копирует чужие. Важно быстро обновлять свои модели мира при появлении новых данных и не бояться менять подходы.
On-policy RL и одна модель вместо спецсистем — путь к AGI. IMO gold это доказал. Обновляйся резко, как…
что из этого моё
Схема из подкаста: обучение идёт как в on-policy RL — сначала имитация чужих решений, потом собственные пробы с обратной связью; новый тип заказа осваивать так же — первый по чужому образцу, дальше на своих ошибках. Остальная часть длинного разговора — Deep Think, олимпиадное золото IMO и сингапурская команда Gemini, к подряду не относится.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать конвейер разборов на on-policy RL: модель оценивает свои прошлые разборы и генерирует улучшения
настроить автоматическую проверку разборов на основе собственных результатов модели
добавить в конвейер этап имитации: первый разбор по образцу, последующие на своих ошибках
о чём говорят, по времени
главы доводят до 08:14 · дальше по ролику меток нет
01
Введение и контекст00:00 ↗
Обсуждение текущего состояния AI и возвращения спикера в Google.
02
Переход к исследованию RL02:35 ↗
Почему спикер переключился на исследование RL и reasoning.
03
On-policy vs off-policy RL04:40 ↗
Разъяснение разницы между on-policy и off-policy обучением.
04
Переход от имитации к самостоятельному обучению06:43 ↗
Когда и почему стоит переходить от имитационного обучения к on-policy.
05
Обновление моделей мира и скорость обучения08:14 ↗
Как быстро и радикально нужно обновлять свои предположения при новых данных.