Qwen 3.8 27B локально: 262k контекста и Claude Code без облака
Тест Qwen 3.8 27B на двух RTX 5070 Ti и 3090: NVFP4 квантование, MTP, контекст до 262k. Лучшая конфигурация для агентов — с MTP и FP8 кэшем, скорость ~55 ток/с. Модель справляется с задачами уровня Claude Code, но медленнее (4 часа против 22 минут).
Тест Qwen 3.8 27B на двух RTX 5070 Ti и 3090: NVFP4 квантование, MTP, контекст до 262k. Лучшая конфигурация для агентов — с MTP и FP8 кэшем, скорость ~55 ток/с. Модель справляется с задачами уровня Claude Code, но медленнее (4 часа против 22 минут).
Можно использовать как референс для настройки локального инференса Qwen 3.8 27B на двух видеокартах: конкретные параметры запуска (NVFP4, MTP, FP8 кэш, отключение Vision) и ожидаемые метрики. Для оркестрации агентов важно, что конфигурация с MTP быстрее и точнее в агентных сценариях, но медленнее при JSON-схемах. Это поможет выбрать оптимальные настройки для локального запуска моделей в автоматизации.