← Материалы разборы Yersham
разбор · оркестрациятема-фронтир · H 1.49
3.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Калибровка LLM-судьи через бинарную оценку и GEPA

GEPA and Prompt Optimization: How to Calibrate LLM-as-a-Judge

В эпоху переизбытка информации критически важны надежные системы оценки AI. Главная проблема - неправильная оценка и галлюцинация нейросетей. Для решения используется откалиброванный судья и алгоритм GEPA, который позволяет ИИ оценивать и улучшать других AI на основе логов и ошибок. Это позволяет достичь скорости алгоритма с качеством, максимально близким к человеческому.

Надёжный LLM-судья требует калибровки через GEPA: бинарные метки, рефлексия, граница Парето, и осторожность с

что из этого моё

При проверке карточек вторым агентом ставить бинарную оценку «годно/брак» с обязательным обоснованием, а не шкалу 1-5 — даже два эксперта не сходятся в «четвёрке». В стартовый промпт проверяющего вписать презумпцию невиновности: без неё судья выдумывает нарушения, лишь бы выполнить приказ «найти ошибку».

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
переписать проверку карточек вторым агентом на бинарную оценку годно/брак с обязательным обоснованием
вписать в стартовый промпт проверяющего презумпцию невиновности
о чём говорят, по времени
главы доводят до 05:12 · дальше по ролику меток нет
01
Введение00:01
Общий контекст проблемы оценки AI.
02
Проблема оценки00:31
Неправильная оценка и галлюцинация нейросетей.
03
Откалиброванные судьи02:03
Важность использования откалиброванных судей для оценки.
04
Метрики и методология03:39
Правильное задание задачи судье с использованием датасета бенчмарка.
05
Алгоритм GEPA05:12
Оптимизация промптов с использованием генетической эволюции.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы