разбор · rlhfбалл 7.0#326 из 1043 · 2026-07-29T03:42:07+00:00
Основы машинного обучения для пост-тренировки LLM и RLHF
Посттренировка LLM — это ключевой этап, где модель переходит от статистического предсказания к агентному поведению через RLHF, используя маски, логарифмы вероятностей и обратный KL для контроля и улучшения качества ответов. Методы Монте-Карло и теория информации помогают оценивать и корректировать модель в реальном времени.
что из этого моё
Понимание механизмов посттренировки и RLHF позволяет строить эффективную оркестрацию моделей и автоматизацию, контролируя качество генерации и обучая ассистентов с учётом человеческих предпочтений.
Что забрать0/4
отметь, что применил →
Использовать Completion Mask, чтобы штрафовать модель только за собственные ответы, игнорируя промпты.
Применять логарифмы вероятностей (log probs) для предотвращения числового underflow при вычислении вероятностей цепочек токенов.
Внедрять температуру в семплирование для создания разнообразия и креативности в ответах, необходимой для RLHF.
Регуляризовать модель через обратный KL дивергенцию, сравнивая новую модель с базовой для предотвращения деградации качества.
карта разбора · 5 глав · 10 пунктов
главы доводят до 10:53 · дальше по ролику меток нет
01
Введение в посттренинг00:02 ↗
Объяснение, почему модели учат через вероятностные симуляции, а не напрямую человеческой логике.
02
Механика генерации текста02:06 ↗
Как модель строит предложения через скрытые состояния и преобразует их в вероятности слов.
03
Маски и обучение на ответах06:15 ↗
Роль Completion Mask для обучения модели только на собственных ответах, а не на промптах.
04
Мидтренинг и качество данных07:15 ↗
Промежуточное обучение переводит модель от статистики к логике, важна не масса, а качество данных.
05
Теория информации и контроль качества10:53 ↗
Использование энтропии, кросс-энтропии и KL-дивергенции для оценки и улучшения модели.
#rlhf#посттренировка#оркестрация#машинное обучение