← Материалы разборы Yersham
разбор · harness
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Сравнение harness'ов для локальных моделей: OpenClaw и OpenCode впереди

COMPARISON of Top Harnesses for Local Models: OpenCode, Pi, Hermes, OpenClaw

Сравнение четырёх harness'ов (OpenCode, Pi, Hermes, OpenClaw) для локальных LLM на бенчмарке из 16 задач и задаче создания low-code платформы. Все harness'ы показали близкие результаты, но OpenClaw и OpenCode выделяются: OpenClaw единственный решил все 16 задач, OpenCode быстрее всех. Для оператора входа в AI полезно: выбор harness'а влияет на скорость и стабильность, но не радикально на качество.

Сравнение четырёх harness'ов (OpenCode, Pi, Hermes, OpenClaw) для локальных LLM на бенчмарке из 16 задач и задаче создания low-code платформы. Все harness'ы показали близкие результаты, но OpenClaw и OpenCode выделяются: OpenClaw единственный решил все 16 задач, OpenCode быстрее всех. Для оператора входа в AI полезно: выбор harness'а влияет на скорость и стабильность, но не радикально на качество.

что из этого моё

Можно использовать бенчмарк (ссылка в описании) для тестирования своих агентов и harness'ов. Выводы по выбору harness'а применимы при оркестрации локальных моделей: OpenClaw для надёжности, OpenCode для скорости. Также учесть, что VLM-бэкенд ускоряет работу, но может ломать тулколлинг у некоторых моделей.

Тезисы ролика
применимого к своей работе линза здесь не нашла
Использовать OpenClaw для максимального качества: единственный harness, закрывший все 16 задач бенчмарка.
Для скорости выбирать OpenCode: показал лучший результат по задачам в час, особенно с VLM.
Учитывать, что Pi встроен в OpenClaw, поэтому при выборе OpenClaw вы получаете Pi как рантайм.
При использовании VLM с Hermes возможны проблемы с тулколлингом (на примере Gemma 431B) — проверять совместимость.
о чём говорят, по времени
главы доводят до 09:10 · дальше по ролику меток нет
01
Введение и бенчмарк00:00
Описание четырёх harness'ов и методологии бенчмарка.
02
Результаты бенчмарка02:06
Анализ графиков: качество, время, стабильность.
03
Задача: low-code платформа04:43
Создание клона n8n с визуальным редактором и вызовом VLM.
04
Результаты на Qwen 35B07:23
Сравнение прототипов, созданных разными harness'ами.
05
Итоги и выводы09:10
Общие выводы по harness'ам и рекомендации.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
ещё разборы