Агент улучшает себя через обвязку и веса, проверяя всю цепочку
Разбор исследования, где систему учат улучшать себя сразу с двух сторон: менять внешнюю обвязку — инструменты и логику вокруг модели — и подстраивать собственные параметры. Ключевой элемент в том, что проверяющий агент видит не только итоговый ответ, но всю цепочку: каждый запрос, каждый вызов инструмента, каждую ошибку. По этой цепочке он определяет, где именно рассуждение свернуло не туда, и решает, что чинить — обвязку или саму модель.
Объединение обновления каркаса и весов даёт синергию, но риск ловушки Гудхарта требует осторожности.
Ту же обратную связь легко повторить у себя без всякой науки: когда прогон конвейера даёт мусор, сохранять всю цепочку — запрос, ответ модели, что сломалось, — и разбирать её, а не только итоговый файл. По одному плохому результату причину не найти, а по записи шагов видно, на каком именно месте всё поехало.