разбор · rlvr
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Посттренинг: RLVR и смена схемы дают 40% против 3%
[State of Post-Training] From GPT-4.1 to 5.1: RLVR, Agent & Token Efficiency — Josh McGrath, OpenAI
Josh McGrath из OpenAI рассказывает о переходе от предобучения к посттренингу, где ключевыми становятся RLVR и оптимизация сигналов обратной связи. Важны новые подходы к оркестрации сложных RL-задач и интерактивности моделей, включая кастомизацию личности и прерываемость сессий.
Пост-трейнинг — это про качество сигнала и токен-эффективность, а не про отдельные методы; главное — данные и
что из этого моё
Выбор из ролика сформулирован цифрами: выигрыш в три процента на эффективности или изменение поведения на сорок процентов сменой подхода. Отсюда правило — не вылизывать промпт ради процентов, когда результат меняет смена самой схемы работы. Остальное — RLVR, оркестрация RL-задач и настройки личности модели, это внутренняя кухня лаборатории.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать промпт разбора под смену схемы, если выигрыш от этого больше 3%
настроить прерывание вывода в конвейере разборов для ручной корректировки
вынести переключатель личности в конфиг для разных сценариев разбора
о чём говорят, по времени
главы доводят до 07:22 · дальше по ролику меток нет
01
Введение и опыт00:02 ↗
Знакомство с Джошем и его ролью в OpenAI, переход от GPT-4.1 к 5.1.
02
Преимущества посттренинга01:08 ↗
Почему посттренинг важнее и сложнее предобучения.
03
Работа с кодом и CodeX03:14 ↗
Использование CodeX для понимания и отладки кода в рантайме.
04
Интерактивность и шоппинг-модель04:45 ↗
Новые подходы к взаимодействию с моделями через прерывание и корректировку.
05
Персонализация и настройки личности07:22 ↗
Важность настройки поведения модели под пользователя.