Josh McGrath из OpenAI рассказывает о переходе от предобучения к посттренингу, где ключевыми становятся RLVR и оптимизация сигналов обратной связи. Важны новые подходы к оркестрации сложных RL-задач и интерактивности моделей, включая кастомизацию личности и прерываемость сессий.
[State of Post-Training] From GPT-4.1 to 5.1: RLVR, Agent & Token Efficiency — Josh McGrath, OpenAI
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение и опыт
Джош работает над моделями мышления и посттренингом в OpenAI, ранее занимался предобучением и данными.
Переход от GPT-4.1 (без мышления) к GPT-5.1 с новыми возможностями и фокусом на посттренинг.
Преимущества посттренинга
Посттренинг позволяет значительно менять поведение моделей (до 40%), в отличие от небольших улучшений предобучения.
RL требует гораздо более сложной инфраструктуры и множества компонентов для оценки и управления задачами.
Работа с кодом и CodeX
Джош активно использует CodeX для быстрого понимания чужого кода и ускорения рабочего процесса.
CodeX меняет ритм работы, позволяя быстро создавать дизайн-документы и разбираться в сложных системах.
Интерактивность и шоппинг-модель
В шоппинг-модели реализована возможность прерывания и изменения цепочки мыслей модели в реальном времени.
Такой подход повышает качество взаимодействия и позволяет пользователям корректировать запросы на лету.
Персонализация и настройки личности
Пользователи ценят возможность выбирать «личность» модели — от холодного инструмента до дружелюбного помощника.
Джош предпочитает режим «Anton» — простой и функциональный, без лишних эмоций, что важно для рабочих задач.