разбор · исследования
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Репликация исследований и RL в объективных задачах
Cooking with OpenAI’s Research Chief: AGI, o1, Evals, and Scaling Laws — Mark Chen
Марка Чена из OpenAI выделяет важность репликации исследований для развития навыков, подчёркивает, что RL лучше работает в объективных задачах, а масштабирование и пре-тренинг остаются ключевыми для прогресса в AI. Он отмечает, что преодоление барьеров требует инженерных и исследовательских инноваций.
OpenAI: ставка на масштабирование и RL, кризис эвалов, будущее за моделями-исследователями, вкус решает.
что из этого моё
Для оператора входа в AI важно использовать репликацию исследований для настройки и оценки моделей, строить оркестрацию с учётом сильных сторон RL в объективных задачах, а также применять масштабирование и пре-тренинг для повышения качества и надёжности агентов и автоматизации.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
воспроизвести ключевую научную работу по своей модели, чтобы понять её поведение
выбрать задачу с чёткими метриками для RL-настройки своей модели
замерить качество своей модели на долгосрочной задаче с высоким контекстом
о чём говорят, по времени
главы доводят до 09:18 · дальше по ролику меток нет
01
Вступление и история с супом00:03 ↗
Знакомство с Марком Ченом и забавной историей о привлечении исследователей через суп.
02
Путь в исследование и навыки02:07 ↗
Обсуждение, как люди без PhD могут стать исследователями и какие качества важны.
03
RL и его ограничения05:44 ↗
Где RL работает хорошо, а где испытывает трудности.
04
Оценка суперчеловеческого интеллекта07:17 ↗
Как оценивать и развивать модели, превосходящие лучших людей.
05
Масштабирование и скепсис09:18 ↗
Марк Чен о важности масштабирования и пре-тренинга, несмотря на критику.