Сад · Росток
Создать датасет с ожидаемыми ответами и прогнать через evals_iterator()
«росток» · 2 карт. · 2 голос.(-а/-ов) корпуса · в пределах одного дня
статьяоценкаdeepevalагентыpydantic-aicrewaiметрики
2 карточек корпуса (2 голос.(-а/-ов) с учётом повторов внутри карточки) независимо друг от друга подошли к одному и тому же действию, в пределах одного дня.
Как формулировали
- создать датасет с примерами input и expected_output и прогнать через dataset.evals_iterator() (2026-08-17)
- создать датасет с ожидаемыми ответами и прогнать крю через evals_iterator() для замера метрик (2026-08-17)
Источники
- Автоматическая оценка CrewAI-крю через DeepEval · 2026-08-17 · частично
- Оценка агентов через DeepEval: метрики и датасет · 2026-08-17 · забрать
Соседние темы
- Подключить DeepEval к CrewAI для трейсинга и метрик — 1 общих карточек, 6 общих тега(ов)
- Вынести ключи и настройки в переменные окружения — 4 общих тега(ов)
- Выносить настраиваемый параметр или правило в конфиг конвейера, а не хардкодить — 3 общих тега(ов)
- Настроить автоматическую оценку ответов агента: LLM-судью или эталонный набор вместо ручной проверки — 3 общих тега(ов)
- Настроить трассировку и логирование вызовов агента и токенов — 2 общих тега(ов)