Agent RFT: дообучение агентов через RL с кастомными наградами
Agent RFT от OpenAI — метод дообучения агентов через RL с кастомными наградами и вызовом внешних инструментов. Позволяет улучшить точность, снизить задержки и стабилизировать поведение агента. Ключевые принципы: чёткая задача, данные как в проде, непрерывная награда, защита от reward hacking.
Agent RFT — мощный метод дообучения агентов: меняет веса под вашу награду, учит работать с инструментами и…
Для оператора входа в AI, который строит оркестрацию и автоматизацию, RFT — это способ дообучить агентов под конкретные сценарии (например, обработка заявок, интеграции). Можно применить принципы: чёткие критерии успеха, непрерывные награды, защита от хакерства, итеративное улучшение. Но RFT требует доступа к API OpenAI и инфраструктуры, поэтому сейчас это скорее стратегическое направление, чем немедленное внедрение.