LMSys Chatbot Arena: краудсорсинг парных сравнений вместо бенчмарков
LMSys Chatbot Arena стала стандартом оценки LLM через краудсорсинг парных сравнений, отказавшись от статических бенчмарков. Ключевые выводы: статические бенчмарки не могут измерить генеративные модели, нужен human-in-the-loop; данные собираются органически, а затем корректируются на стилевые и другие факторы через регрессионный анализ.
LMSys сделал оценку LLM живой: анонимные баттлы, контроль стиля и открытость. Бенчмарк не насыщен, но требует…
Можно применить подход к оценке качества ответов моделей в оркестрации: вместо единого скоринга использовать парные сравнения и контролировать стилевые факторы. Также идея роутинга на основе сложности запроса напрямую применима для автоматизации выбора модели.
авто 2026-09-04, приём 3, прогон 20260904-045026