Multi-turn RL: промежуточные оценки и token budget против reward hacking
Обсуждение релиза Claude 4: акцент на агентности и tool use, а не на чистом reasoning. Разбор multi-turn RL для обучения агентов, проблемы reward hacking и способы борьбы через промежуточные оценки и кредитное присваивание. Контекст о спорных safety-тестах и будущем evals.
Мультиходовый RL с GRPO и промежуточными наградами — ключ к настоящему tool use, но требует борьбы с dummy-выз
Практические выводы для оркестрации агентов: при настройке RL для tool use включайте в reward не только конечный ответ, но и качество промежуточных шагов (например, релевантность поиска). Используйте token budget для управления стоимостью и латентностью в продакшене. При выборе моделей для автоматизации учитывайте их склонность к reward hacking и лишним действиям — это прямо влияет на надёжность пайплайнов.