разбор · агентытема-фронтир · H 1.51
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
EvoHarness-RL: три компонента состояния и четыре действия для агентов
EvoHarness-RL обучает LLM-агентов автономно управлять вниманием и памятью через три ключевых компонента: belief (представление мира), progress (прогресс задачи) и experience (опыт). Это позволяет избежать переполнения контекста и повысить эффективность в многоэтапных задачах, существенно превосходя классические модели.
Модель Qwen 8B с внешним контекстом BPE достигает 97% успеха, экономя память и обучаясь самостоятельно.
что из этого моё
Принцип разделения управления внутренним состоянием агента на belief, progress и experience можно внедрить в оркестрацию LLM-агентов для повышения автономности и снижения нагрузки на контекст, а cost-aware RL поможет оптимизировать использование внешних ресурсов и памяти.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
разделить управление состоянием агента на belief, progress и experience в конвейере разборов
добавить четыре базовых действия track, commit, recall, note в оркестрацию агента
настроить cost-aware PPO для баланса использования памяти и действий
о чём говорят, по времени
главы доводят до 14:03 · дальше по ролику меток нет
01
Введение и контекст00:06 ↗
Обзор парадокса: меньшая модель превосходит гигантов за счёт ленивого управления вниманием.
02
Проблемы классических систем памяти02:13 ↗
Почему внешние базы и жёсткие правила не работают эффективно.
03
Концепция BPE и четыре базовых действия05:49 ↗
Разделение управления на belief, progress и experience с действиями track, commit, recall, note.
04
Пример работы в Alf World09:56 ↗
Сравнение классической модели и EvoHarness-RL на бытовой задаче.
05
Обучение и cost-aware RL14:03 ↗
Двухэтапное обучение: SFT и оптимизация с учётом стоимости вызовов памяти.