← Материалы разборы Yersham
разбор · дистилляция
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Дистилляция DeepSeek R1 в Qwen 32B за 48 часов превзошла o1

The Unreasonable Effectiveness of Reasoning Distillation: using DeepSeek R1 to beat OpenAI o1

Команда Bespoke Labs за 48 часов дистиллировала DeepSeek R1 в Qwen 32B, создав модель Bespoke Stratos, которая превзошла OpenAI o1 preview. Ключевой вывод: качество синтетических данных от сильного учителя критически важно, а сложный поиск не нужен — авторегрессионная генерация с backtracking достаточно.

Дистилляция R1 в Qwen за 48 часов: качественные данные решают, поиск не нужен, студент может обойти учителя.

что из этого моё

Для оператора входа в AI это прямое руководство: можно быстро создавать специализированные модели под задачи оркестрации и автоматизации, используя дистилляцию сильных открытых моделей. Например, взять DeepSeek R1 как учителя, сгенерировать данные на своих сценариях (форматирование ответов, планирование шагов), отфильтровать по правильности и дообучить небольшую модель для быстрых и дешёвых инференсов в пайплайне.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
сгенерировать синтетические reasoning-трейсы через DeepSeek R1 на своих сценариях и отфильтровать по правильности ответа
дообучить Qwen 32B на отфильтрованных трейсах для быстрого инференса в конвейере разборов
замерить качество и скорость дистиллированной модели на задачах форматирования и планирования
о чём говорят, по времени
главы доводят до 16:00 · дальше по ролику меток нет
01
Вступление и контекст00:00
Команда Bespoke Labs рассказывает о себе и о том, как они за 48 часов выпустили модель после релиза DeepSeek R1.
02
Что такое дистилляция04:00
Объясняются уровни дистилляции: от логитов до данных, и почему важно иметь доступ к reasoning-трейсам.
03
Особенности reasoning-данных08:00
Обсуждается, как выглядят трейсы R1, их длина и стиль, и почему они лучше, чем у QwQ.
04
Результаты и масштабирование12:00
Команда делится результатами: 7B модель улучшилась, 32B превзошла o1 preview, и обсуждают влияние объёма данных.
05
Будущее и выводы16:00
Обсуждаются перспективы RL без SFT, роль поиска и важность качества данных.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы