Малые LLM до 9B: баланс возможностей и ограничений в агентских задачах
Тест малых локальных LLM (3-9B) в агентских задачах: работа с кодом, websearch и tool calling. Лучшие: Omnicoder 9B, Ministral 3.8B, Qwen 9B. Многие модели ломаются на вызове тулов или записи JSON. Для практики лучший баланс у Nemotron 3 Nano 4B.
Тест малых локальных LLM (3-9B) в агентских задачах: работа с кодом, websearch и tool calling. Лучшие: Omnicoder 9B, Ministral 3.8B, Qwen 9B. Многие модели ломаются на вызове тулов или записи JSON. Для практики лучший баланс у Nemotron 3 Nano 4B.
Можно использовать результаты для выбора локальных моделей в оркестрации агентов: отдавать предпочтение Omnicoder 9B и Ministral 3.8B для задач с кодом, а для tool calling — Nemotron 3 Nano 4B. Также полезно внедрить бенчмарк tool calling для оценки моделей перед интеграцией.