Сад · Корень
Настроить автоматическую оценку ответов агента: LLM-судью или эталонный набор вместо ручной проверки
«корень» · 12 карт. · 12 голос.(-а/-ов) корпуса · 203 дн. между первым и последним
оркестрацияагентыllmоценкаавтоматизациятрассировкаobservabilityоптимизация
12 карточек корпуса (12 голос.(-а/-ов) с учётом повторов внутри карточки) независимо друг от друга подошли к одному и тому же действию, за 203 дн. (2026-01-26 — 2026-08-17).
Как формулировали
- создать детерминированный эвал с golden-данными для проверки ответов агента вместо LLM-as-judge
- использовать детерминированную оценку на golden-данных вместо LLM-as-judge
- настроить LM-судью для оценки ответов в конвейере разборов
- настроить автоматического судью на основе LLM для оценки результатов своих агентов (2026-01-26)
- настроить LLM-as-judge для автоматической проверки ответов в CI
- настроить private eval на своих данных для оценки моделей (2026-06-25)
- сравнить оценки LLM-судьи с оценками экспертов на своих данных
- настроить классификатор на GPT-4 для оценки ответов (2026-05-25)
- настроить LLM-as-judge эвалюацию для оценки ответов агента (2026-08-17)
- настроить LLM-as-a-judge с кастомным промптом для автоматической оценки ответов в конвейере разборов (2026-08-17)
- настроить EVAL-систему для оценки ответов моделей в конвейере разборов (2026-06-17)
- настроить LLM-судью на GPT-4 с temperature 0 для оценки ответов своего конвейера
Источники
- Мульти-агенты для независимых задач, сингл-агенты для зависимых · частично
- Пять столпов продакшн-релиза AI-агентов · частично
- Эвалюация LLM: систематическое измерение и улучшение · частично
- Phind: открытые модели обгоняют GPT-4 при поиске и дообучении · частично
- GEPA повышает точность промптов с 87% до 96% · забрать
- REPL с persistent state поднимает точность агентов с 50% до 92% · забрать
- Оценка кода: реалистичные бенчмарки и выявление читинга · 2026-01-26 · мимо
- FuzzyAI автоматизирует поиск джейлбрейков в LLM API · 2026-05-25 · частично
- Скорость разработки в Anthropic: недели вместо месяцев · 2026-06-17 · мимо
- Экосистема AI: частные оценки и мультимодальные хранилища · 2026-06-25 · частично
- Arize Phoenix: трассировка и оценка LLM-приложений · 2026-08-17 · частично
- Langfuse: трейсинг, промпт-менеджмент и эвалюации LLM · 2026-08-17 · забрать
Соседние темы
- Подключать MCP-сервер к своему конвейеру разборов или к Claude Code — 1 общих карточек, 14 общих тега(ов)
- Выносить настраиваемый параметр или правило в конфиг конвейера, а не хардкодить — 1 общих карточек, 13 общих тега(ов)
- Автоматизировать рутинные задачи агента по расписанию (крон, таймер) — 1 общих карточек, 8 общих тега(ов)
- Добавить в конвейер шаг проверки или подтверждения перед действиями агента — 1 общих карточек, 6 общих тега(ов)
- Поставить новый агентный инструмент или плагин и прогнать его на своём проекте — 9 общих тега(ов)