← Материалы разборы Yersham
разбор · rlvrбалл 8.0#283 из 911 · 2026-01-26

Josh McGrath из OpenAI рассказывает о переходе от предобучения к посттренингу, где ключевыми становятся RLVR и оптимизация сигналов обратной связи. Важны новые подходы к оркестрации сложных RL-задач и интерактивности моделей, включая кастомизацию личности и прерываемость сессий.

[State of Post-Training] From GPT-4.1 to 5.1: RLVR, Agent & Token Efficiency — Josh McGrath, OpenAI

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Оператору входа в AI важно внедрять RLVR и гибкие сигналы обратной связи для улучшения качества агентов и автоматизаций, использовать интерактивные модели с возможностью прерывания и кастомизации, а также применять CodeX для быстрой диагностики и оркестрации сложных процессов.

карта разбора · 5 ветокклик по цифре — раскрыть главу
суть01Введение и опыт02Преимущества посттр…03Работа с кодом и Co…04Интерактивность и ш…05Персонализация и на…

наведи и нажми на цифру — раскроется глава

полный разбор ролика · 5 глав
01

Введение и опыт

Джош работает над моделями мышления и посттренингом в OpenAI, ранее занимался предобучением и данными.

Переход от GPT-4.1 (без мышления) к GPT-5.1 с новыми возможностями и фокусом на посттренинг.

02

Преимущества посттренинга

Посттренинг позволяет значительно менять поведение моделей (до 40%), в отличие от небольших улучшений предобучения.

RL требует гораздо более сложной инфраструктуры и множества компонентов для оценки и управления задачами.

03

Работа с кодом и CodeX

Джош активно использует CodeX для быстрого понимания чужого кода и ускорения рабочего процесса.

CodeX меняет ритм работы, позволяя быстро создавать дизайн-документы и разбираться в сложных системах.

04

Интерактивность и шоппинг-модель

В шоппинг-модели реализована возможность прерывания и изменения цепочки мыслей модели в реальном времени.

Такой подход повышает качество взаимодействия и позволяет пользователям корректировать запросы на лету.

05

Персонализация и настройки личности

Пользователи ценят возможность выбирать «личность» модели — от холодного инструмента до дружелюбного помощника.

Джош предпочитает режим «Anton» — простой и функциональный, без лишних эмоций, что важно для рабочих задач.

#rlvr#посттренинг#оркестрация#агенты
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы