RL-агент сокращает восстановление ETL с 2.5 дней до 26 секунд
Доклад Анны Мари Бензон об RL-агенте для автоматизации обработки сбоев ETL. Система сочетает детерминированные правила, Q-learning и внешний слой безопасности, сокращая время восстановления с 2.5 дней до ~26 секунд в бенчмарке. Главный вывод: ценность не в RL как таковом, а в четком разделении фактов, обучения и безопасности.
RL-агент автоматизирует ETL-сбои: правила для фактов, RL для выбора, safety для границ — MTT R на 99.85% меньш
Подход применим для построения надежных агентов оркестрации: разделение фактов (детерминированные проверки), обучения (выбор действия) и безопасности (оверрайды) повышает доверие к автоматизации. Конкретно: можно использовать компактное состояние (тип ошибки, риск) и Q-learning для выбора между retry, rollback, quarantine, escalate, а безопасность вынести в отдельный слой. Также полезен принцип эскалации как действия и обязательный аудит.