Перевзвешивание PPO с оценками +1/0/-1 повышает успех агентов до 90%
Многошаговые AI-агенты страдают от информационной самоблокировки: они избегают поиска и выдумывают факты, потому что обучение с подкреплением штрафует за ошибки на промежуточных шагах. Решение — перевзвешивание функции преимущества в PPO с помощью простых оценок +1/0/-1, что перераспределяет вероятности внутри траектории без дополнительных вычислений. Это повышает успех до 90% и производительность до 60%.
Лень агентов — следствие RL: перераспределение вероятностей в PPO за 20 строк даёт +60% к успеху.
Метод перевзвешивания функции преимущества с простыми оценками +1/0/-1 можно применить для обучения агентов, которые выполняют многошаговые задачи в оркестрации: например, агент, который ищет информацию по API, может получать мгновенную оценку каждого запроса, что снизит галлюцинации и повысит точность. Это также дает подход к отладке собственных агентов: вводите промежуточные сигналы, чтобы модель не срезала углы.