Сад · Побег
Замерить стоимость и качество своей модели против модели-флагмана
«побег» · 4 карт. · 4 голос.(-а/-ов) корпуса · 122 дн. между первым и последним
автоматизацияагентыоркестрацияииоптимизацияфильтрация данныхпамятьreasoning
4 карточек корпуса (4 голос.(-а/-ов) с учётом повторов внутри карточки) независимо друг от друга подошли к одному и тому же действию, за 122 дн. (2026-03-25 — 2026-07-25).
Как формулировали
- замерить стоимость и качество ответов на своей модели против флагмана на тестовом наборе запросов (2026-07-21T03:09:27+00:00)
- замерить стоимость токенов памяти против стоимости модели на своих данных (2026-03-25)
- замерить, насколько улучшится качество разборов при замене текущей модели на o3
- замерить стоимость и качество разборов на текущей модели против флагмана на своих данных (2026-07-25T03:24:01+00:00)
Источники
- Test-time compute: харнесы временны, данные и RL-файнтюнинг остаются · частично
- Память агента как хук с графовой базой вместо статичных файлов · 2026-03-25 · частично
- Kimi K3: дешёвая модель обходит флагманы на математике и коде · 2026-07-21T03:09:27+00:00 · мимо
- Модель на ступень ниже обходит флагман по качеству и цене · 2026-07-25T03:24:01+00:00 · частично
Соседние темы
- Подключать MCP-сервер к своему конвейеру разборов или к Claude Code — 1 общих карточек, 8 общих тега(ов)
- Настроить автоматическую оценку ответов агента: LLM-судью или эталонный набор вместо ручной проверки — 6 общих тега(ов)
- Выносить настраиваемый параметр или правило в конфиг конвейера, а не хардкодить — 5 общих тега(ов)
- Автоматизировать рутинные задачи агента по расписанию (крон, таймер) — 5 общих тега(ов)
- Настроить трассировку и логирование вызовов агента и токенов — 5 общих тега(ов)