Современные посттрейнинговые рецепты для LLM эволюционируют от простых трёхступенчатых схем к сложным с многоэтапным RL и дистилляцией от нескольких учителей. Ключевой тренд — интеграция специализированных моделей и инструментов, что требует сложной оркестрации и управления процессом.
The State of Frontier Post-Training Recipes | Conversation with Finbarr Timbers
полный разбор ролика · 5 глав ↓
Введение и контекст
Обсуждается значимость посттрейнинга Olmo 3 как сложного проекта, который отражает ограничения организационной структуры AI2 и переход к более сложным рецептам.
Отмечается, что современные модели требуют новых подходов, отличающихся от простых трёхступенчатых схем, и начинается обсуждение эволюции рецептов.
Обзор канонических рецептов
Представлены ключевые рецепты: Instruct GPT (SFT, reward model, RL), Llama 3 и Tulu 3 как практические реализации, а также новые рецепты DeepSeek R1 и Nemo Flash с добавлением дистилляции.
Отмечается переход от простых схем к более сложным с акцентом на RL и дистилляцию, что отражает современные тренды в развитии моделей.
Дистилляция и её разновидности
Различают дистилляцию от ведущих закрытых моделей и дистилляцию специализированных моделей (математика, кодинг, логика) с последующим объединением знаний.
Подчёркивается, что дистилляция — это не единый процесс, а комплекс техник, которые применяются для повышения эффективности и качества моделей.
Текущие практики посттрейнинга
Современные рецепты отходят от активного использования человеческих демонстраций в SFT и смещаются в сторону синтетических данных и более сложных RL-стадий.
Увеличивается количество итераций и использование различных техник, таких как rejection sampling и DPO, для улучшения качества моделей.
Сложность и масштабирование
Переход от простых команд к крупным проектам с большим объёмом специализированных данных и ресурсов.
Отмечается, что консультирование по посттрейнингу требует глубокого понимания конкретных рецептов, что усложняет передачу универсальных рекомендаций.