Сад · Росток
Собрать реальные вопросы заказчиков и прогнать через модель как приёмочный список
«росток» · 2 карт. · 2 голос.(-а/-ов) корпуса · 133 дн. между первым и последним
оркестрацияоценкаплатформаинфраструктураaiавтоматизация
2 карточек корпуса (2 голос.(-а/-ов) с учётом повторов внутри карточки) независимо друг от друга подошли к одному и тому же действию, за 133 дн. (2026-01-26 — 2026-06-08).
Как формулировали
- собрать два десятка настоящих запросов заказчиков и проверять модели на них (2026-01-26)
- собрать два-три десятка настоящих вопросов из переписки заказчика как список приёмки и прогнать бота по ним (2026-06-08)
Источники
- LMArena: оценка моделей на реальных пользовательских запросах · 2026-01-26 · мимо
- Оценка моделей: свои метрики вместо покупных · 2026-06-08 · частично
Соседние темы
- Настроить автоматическую оценку ответов агента: LLM-судью или эталонный набор вместо ручной проверки — 4 общих тега(ов)
- Выносить настраиваемый параметр или правило в конфиг конвейера, а не хардкодить — 3 общих тега(ов)
- Автоматизировать рутинные задачи агента по расписанию (крон, таймер) — 3 общих тега(ов)
- Настроить трассировку и логирование вызовов агента и токенов — 3 общих тега(ов)
- Завести файл с правилами проекта для агента (CLAUDE.md, AGENTS.md, KNOWLEDGE.md) — 3 общих тега(ов)