Компактная модель обходит триллионную в задаче лифта
В сравнении между MIM 2.5 Pro и Kimi K2.6 показано, что большие модели не всегда лучше. MIM 2.5 Pro демонстрирует более эффективное решение задачи с использованием стратегического планирования и самокоррекции, в то время как Kimi K2.6 страдает от перегрузки контекстного окна и неэффективного распределения внимания.
В тесте на логику MiMo 2.5 Pro (10 шагов) и компактные модели (8-9) обходят Kimi K2.6, которая падает. Размер…
Малая модель в этом тесте бьёт триллионную: Qwen 3.6 с тремя миллиардами активных параметров прошла лифт за семь шагов на ноутбуке, а MiMo 2.5 Pro с триллионом и требованием в 80 ГБ видеопамяти — за десять, причём первые шесть шагов топталась. Для логики заказных ботов сначала пробовать компактную модель, флагман — только когда малая не вытянула.