← Материалы разборы Yersham
разбор · обучениетема решённая · H 1.09
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Дообучение на узких задачах ломает общие способности модели

PivotRL: Efficient Retraining of Agent Systems with Local On-Policy Pivot Steps

Разбор исследования Nvidia о дообучении агентных моделей: обычное обучение на примерах ломает общие способности — после натаскивания на команды терминала результат модели на олимпиадных задачах упал с 86 до 21 процента. Причина в том, что алгоритм жёстко наказывает за любые варианты, кроме показанного, и распределение вероятностей схлопывается. Предложенный метод отбирает для обучения только поворотные шаги, где исходы разнородны, и оценивает смысл действия, а не точное совпадение строк.

PivotRL: дешевое дообучение агентов через фильтрацию ключевых шагов и функциональные награды, сохраняя общие з

что из этого моё

Тема про обучение моделей — к заказам на боты и сайты не относится. Одно наблюдение всё же общее: узкая натаскиваемость съедает общую сообразительность, поэтому под нетипичную задачу заказчика лучше брать сильную общую модель и объяснять ей контекст, чем искать узкоспециальную.

Тезисы ролика
применимого к своей работе линза здесь не нашла
После дообучения на командах терминала точность на сложном математическом тесте обрушилась с 86 до 21 процента — это цена узкой специализации.
Механизм потери: обучение резко обрубает все варианты, кроме показанного, и модель перестаёт рассматривать альтернативы.
Проверка показала, что более 71 процента случайно взятых промежуточных шагов не дают сигнала для обучения — вычисления тратятся впустую.
Требование точного совпадения строк отбраковывает верные по смыслу решения, записанные иначе.
о чём говорят, по времени
главы доводят до 06:44 · дальше по ролику меток нет
01
Вступление00:02
Объявление темы и анонс исследования Nvidia.
02
Аналогия обучения01:03
Аналогия с поэтом, который учится чинить сантехнику.
03
Конфликт эффективности и обобщения02:07
Обсуждение проблемы современного машинного обучения.
04
Методы обучения03:07
Сравнение методов SFT и IT.
05
Пивот RL06:44
Введение метода пивот RL и его преимущества.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы