← Материалы разборы Yersham
разбор · rlбалл 8.0#287 из 911 · 2026-01-26

Основной инсайт — переход от имитационного обучения к on-policy RL, когда модель учится на собственных ошибках и генерациях, а не копирует чужие. Важно быстро обновлять свои модели мира при появлении новых данных и не бояться менять подходы.

Captaining IMO Gold, Deep Think, On-Policy RL, Feeling the AGI in Singapore — Yi Tay

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Оператору входа в AI полезно внедрять on-policy RL для автоматизации обучения агентов и моделей, чтобы они адаптировались на основе собственных действий. Это улучшит оркестрацию и повысит качество автоматизации без постоянного ручного вмешательства.

карта разбора · 5 ветокклик по цифре — раскрыть главу
суть01Введение и контекст02Переход к исследова…03On-policy vs off-po…04Переход от имитации…05Обновление моделей…

наведи и нажми на цифру — раскроется глава

полный разбор ролика · 5 глав
01

Введение и контекст

Спикер делится ощущением прогресса AI в разных сферах, включая кодинг и генерацию изображений.

Рассказывает о возвращении в Google и изменениях в инфраструктуре, подчеркивая плавность адаптации.

02

Переход к исследованию RL

Он объясняет, что переключился с архитектур и предобучения на RL, видя в нем основной инструмент моделирования.

Подчеркивает универсальность исследовательских навыков и легкость адаптации к новым инструментам.

03

On-policy vs off-policy RL

On-policy — обучение на собственных генерациях модели с последующей оценкой и корректировкой.

Off-policy — обучение на данных, сгенерированных другими моделями или из внешних источников.

Спикер приводит аналогии с человеческим обучением, подчеркивая важность самостоятельного опыта.

04

Переход от имитации к самостоятельному обучению

Имитация полезна на начальных этапах, но для прогресса требуется самостоятельный поиск и получение обратной связи.

Человеческое обучение аналогично — сначала копирование, затем самостоятельная практика.

Подчеркивается важность безопасной среды для экспериментов и ошибок.

05

Обновление моделей мира и скорость обучения

Спикер советует при появлении контрпримеров резко менять свои модели, а не делать минимальные корректировки.

Приводит пример с генеративными моделями и резким изменением восприятия после появления stable diffusion.

Рекомендует планировать «фазы обучения» с учетом изменения парадигм.

#rl#on-policy#обучение#оркестрация
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы