Калибровка LLM-судьи через бинарную оценку и GEPA
В эпоху переизбытка информации критически важны надежные системы оценки AI. Главная проблема - неправильная оценка и галлюцинация нейросетей. Для решения используется откалиброванный судья и алгоритм GEPA, который позволяет ИИ оценивать и улучшать других AI на основе логов и ошибок. Это позволяет достичь скорости алгоритма с качеством, максимально близким к человеческому.
Надёжный LLM-судья требует калибровки через GEPA: бинарные метки, рефлексия, граница Парето, и осторожность с
При проверке карточек вторым агентом ставить бинарную оценку «годно/брак» с обязательным обоснованием, а не шкалу 1-5 — даже два эксперта не сходятся в «четвёрке». В стартовый промпт проверяющего вписать презумпцию невиновности: без неё судья выдумывает нарушения, лишь бы выполнить приказ «найти ошибку».