← Материалы разборы Yersham
разбор · посттрейнингбалл 7.0#368 из 823 · 2026-06-25

Современные посттрейнинговые рецепты для LLM эволюционируют от простых трёхступенчатых схем к сложным с многоэтапным RL и дистилляцией от нескольких учителей. Ключевой тренд — интеграция специализированных моделей и инструментов, что требует сложной оркестрации и управления процессом.

The State of Frontier Post-Training Recipes | Conversation with Finbarr Timbers

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Оператору входа в AI важно строить гибкую оркестрацию, которая поддерживает многоступенчатые рецепты с RL и дистилляцией, интегрирует специализированные модели и автоматизирует сложные пайплайны посттрейнинга.

полный разбор ролика · 5 глав
01

Введение и контекст

Обсуждается значимость посттрейнинга Olmo 3 как сложного проекта, который отражает ограничения организационной структуры AI2 и переход к более сложным рецептам.

Отмечается, что современные модели требуют новых подходов, отличающихся от простых трёхступенчатых схем, и начинается обсуждение эволюции рецептов.

02

Обзор канонических рецептов

Представлены ключевые рецепты: Instruct GPT (SFT, reward model, RL), Llama 3 и Tulu 3 как практические реализации, а также новые рецепты DeepSeek R1 и Nemo Flash с добавлением дистилляции.

Отмечается переход от простых схем к более сложным с акцентом на RL и дистилляцию, что отражает современные тренды в развитии моделей.

03

Дистилляция и её разновидности

Различают дистилляцию от ведущих закрытых моделей и дистилляцию специализированных моделей (математика, кодинг, логика) с последующим объединением знаний.

Подчёркивается, что дистилляция — это не единый процесс, а комплекс техник, которые применяются для повышения эффективности и качества моделей.

04

Текущие практики посттрейнинга

Современные рецепты отходят от активного использования человеческих демонстраций в SFT и смещаются в сторону синтетических данных и более сложных RL-стадий.

Увеличивается количество итераций и использование различных техник, таких как rejection sampling и DPO, для улучшения качества моделей.

05

Сложность и масштабирование

Переход от простых команд к крупным проектам с большим объёмом специализированных данных и ресурсов.

Отмечается, что консультирование по посттрейнингу требует глубокого понимания конкретных рецептов, что усложняет передачу универсальных рекомендаций.

#посттрейнинг#оркестрация#rl#дистилляция
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы