разбор · llmтема-фронтир · H 1.53
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Llama 2 и 3: переобучение вместо размера, RLHF через оценку
Training Llama 2, 3 & 4: The Path to Open Source AGI — with Thomas Scialom of Meta AI
Томас Сиалом из Meta AI рассказывает о создании Llama 2 и 3: ключевые решения по масштабированию, синтетическим данным, RLHF и архитектуре. Главный вывод: для инференса выгоднее переобучать модели, а не гнаться за размером, а RLHF позволяет превзойти человеческие способности за счет оценки, а не генерации.
Llama 3 — ставка на данные и пост-обучение: 15 трлн токенов и RLHF вместо архитектурных инноваций. Ловушка…
что из этого моё
Прямой пользы для оператора входа в AI мало: видео о внутренней кухне Meta AI, но можно почерпнуть идеи для автоматизации оценки качества моделей (например, использовать попарные предпочтения вместо абсолютных оценок) и для синтетической генерации данных при настройке агентов.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать промпт для оценки ответов агента на попарные предпочтения вместо абсолютных оценок
настроить генерацию синтетических данных от лучшей модели для пост-обучения агента
вынести правило фильтрации данных сильной моделью в конвейер разборов
о чём говорят, по времени
главы доводят до 35:00 · дальше по ролику меток нет
01
Интро и бэкграунд00:00 ↗
Томас рассказывает о пути от квант-финансов до NLP и начале работы в Meta.
02
История Llama 205:00 ↗
Как создавалась Llama 2: от Galactica до масштабирования аннотаций.
03
Масштабирование и Чинчилла15:00 ↗
Обсуждение законов масштабирования и «ловушки Чинчиллы».
04
Данные и синтетика25:00 ↗
Как Llama 2 использовалась для очистки данных и синтетической генерации.
05
RLHF и пост-обучение35:00 ↗
Почему RLHF работает и как его применяли в Llama 3.