разбор · агентытема-фронтир · H 1.51
4.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Многошаговый RL с инструментами и субагентами для длинных горизонтов
⚡️Open Questions in Agentic RL — Will Brown (Prime Intellect)
Доклад о ключевых проблемах и путях развития open-source агентного RL для создания моделей уровня o3. Основной фокус — многошаговое использование инструментов, вознаграждение на уровне шагов, асинхронность, мультимодальность через инструменты и децентрализованное обучение с последующим слиянием моделей.
Путь к 03: multi-turn RL с инструментами, асинхронность и децентрализация через merging — главные кирпичи.
что из этого моё
Для оператора входа в AI ключевое — строить оркестрацию на основе многошаговых вызовов инструментов, внедрять промежуточные проверки и асинхронность, чтобы масштабировать агентов. Использовать субагентов для сжатия контекста и слияние моделей для децентрализованного обучения.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать конвейер разборов на многошаговые вызовы инструментов с проверкой результата на каждом шаге
вынести субагента для сжатия контекста в отдельный модуль и подключить его к обработке длинных транскриптов
настроить асинхронный запуск обучения, инференса и вознаграждения в конвейере разборов
о чём говорят, по времени
главы доводят до 10:00 · дальше по ролику меток нет
01
Введение и цель00:00 ↗
Спикер обозначает цель — создать open-source модель уровня o3 для длинных задач.
02
Многошаговый RL02:30 ↗
Переход от одношагового RL к многошаговому с инструментами.
03
Мультимодальность и инструменты05:00 ↗
Использование программных инструментов для работы с изображениями вместо генерации в рассуждениях.
04
Субагенты и контекст07:30 ↗
Использование субагентов как инструментов для сжатия информации.
05
Асинхронность и децентрализация10:00 ↗
Асинхронные пайплайны и слияние моделей для масштабирования.