Дистилляция DeepSeek R1 в Qwen 32B за 48 часов превзошла o1
Команда Bespoke Labs за 48 часов дистиллировала DeepSeek R1 в Qwen 32B, создав модель Bespoke Stratos, которая превзошла OpenAI o1 preview. Ключевой вывод: качество синтетических данных от сильного учителя критически важно, а сложный поиск не нужен — авторегрессионная генерация с backtracking достаточно.
Дистилляция R1 в Qwen за 48 часов: качественные данные решают, поиск не нужен, студент может обойти учителя.
Для оператора входа в AI это прямое руководство: можно быстро создавать специализированные модели под задачи оркестрации и автоматизации, используя дистилляцию сильных открытых моделей. Например, взять DeepSeek R1 как учителя, сгенерировать данные на своих сценариях (форматирование ответов, планирование шагов), отфильтровать по правильности и дообучить небольшую модель для быстрых и дешёвых инференсов в пайплайне.