Дообучение на узких задачах ломает общие способности модели
Разбор исследования Nvidia о дообучении агентных моделей: обычное обучение на примерах ломает общие способности — после натаскивания на команды терминала результат модели на олимпиадных задачах упал с 86 до 21 процента. Причина в том, что алгоритм жёстко наказывает за любые варианты, кроме показанного, и распределение вероятностей схлопывается. Предложенный метод отбирает для обучения только поворотные шаги, где исходы разнородны, и оценивает смысл действия, а не точное совпадение строк.
PivotRL: дешевое дообучение агентов через фильтрацию ключевых шагов и функциональные награды, сохраняя общие з
Тема про обучение моделей — к заказам на боты и сайты не относится. Одно наблюдение всё же общее: узкая натаскиваемость съедает общую сообразительность, поэтому под нетипичную задачу заказчика лучше брать сильную общую модель и объяснять ей контекст, чем искать узкоспециальную.