Марка Чена из OpenAI выделяет важность репликации исследований для развития навыков, подчёркивает, что RL лучше работает в объективных задачах, а масштабирование и пре-тренинг остаются ключевыми для прогресса в AI. Он отмечает, что преодоление барьеров требует инженерных и исследовательских инноваций.
Cooking with OpenAI’s Research Chief: AGI, o1, Evals, and Scaling Laws — Mark Chen
полный разбор ролика · 5 глав ↓
Вступление и история с супом
Марка Чена пригласили в кулинарное шоу, где он рассказал о том, как приносил суп исследователям в OpenAI, чтобы создать комфортную атмосферу и удержать таланты.
Это иллюстрирует важность нестандартных подходов и заботы о команде в условиях высокой конкуренции.
Путь в исследование и навыки
Главное — умение творчески решать задачи и мыслить нестандартно, а не обязательно наличие формального образования.
Репликация научных работ — лучший способ развить исследовательский вкус и понять тонкости методов.
RL и его ограничения
RL эффективен в задачах с объективной оценкой, например, программировании или математике.
В субъективных областях, например, творческом письме, RL пока слабо применим из-за сложности оценки результата.
Оценка суперчеловеческого интеллекта
Прорывы происходят через взаимодействие с реальным миром и задачи с высоким контекстом.
Кодирование и совместная работа — тесты для способности моделей учиться в сложных условиях.
Масштабирование и скепсис
Масштабирование и пре-тренинг продолжают давать экспоненциальный рост возможностей моделей.
История показывает, что каждая новая инженерная или исследовательская идея помогает преодолеть ранее считавшиеся непреодолимыми барьеры.