Оценка моделей: свои метрики вместо покупных
Разбор дискуссии о том, как разработчики понимают, что их продукт на основе модели действительно работает. Готовые покупные метрики названы самым быстрым способом получить бесполезную систему оценки: сторонний показатель ничего не знает о конкретном бизнесе, а поручать одной модели оценивать другую из лени — то же, что дать ученику самому поставить себе отметку. Разбирается и обратная сторона: приемлемость ошибки зависит от области — там, где выдумка модели безобидна для писателя, в финансах она недопустима.
Оценка ИИ — это компас разработки: сначала ручной анализ ошибок, потом статистика и калибровка судей, иначе…
Перед сдачей бота заказчику прописать в нём границу разговора — «отвечаю про запись, цены и адрес, остальное передаю человеку», иначе клиенты быстро превратят его в бесплатного помощника не по теме. И собрать два-три десятка настоящих вопросов из переписки заказчика как список приёмки: прогнать бота по ним и показать результат, а не обещать словами, что он работает.