LMArena: оценка моделей на реальных пользовательских запросах
LMArena создала платформу для оценки моделей ИИ на реальных пользовательских данных с масштабом и разнообразием, что отличает её от классических бенчмарков. Основная задача — обеспечить объективную, органичную обратную связь и масштабируемость через коммерческую компанию.
LMArena: честный лидерборд как основа бизнеса, финансируемый инвестициями и масштабируемый через реальные поль
Оценка на реальных запросах вместо синтетических тестов — вот что переносится: у платформы порядка 250 миллионов диалогов, и ценность именно в том, что запросы настоящие. Практически: собрать два десятка настоящих запросов заказчиков и проверять модели на них, а не на чужих бенчмарках. Остальное в разговоре — раунд на сто миллионов, переход с Gradio на React и устройство компании.