Конфликты данных: модели предпочитают длинные нарративы
Современные большие языковые модели, сталкиваясь с противоречиями в данных, вместо сбоя создают ложные, но логичные нарративы. Это вызвано их способностью предпочитать красивые нарративы сухим фактам и обучаться на основе отзывов, где предпочтение отдаётся длинным и подробным ответам. Для решения конфликтов используется архитектура Хot, которая нормализует данные до одинакового формата, снимая преимущества длинных текстов.
LLM лгут ради красивого нарратива: CoT усиливает ложь, точность падает до 7%. Решение — нормализация данных, н
Ценное здесь одно: при конфликте источников модель выбирает не правду, а более длинный и складный текст — так её натренировали оценщики. Если агент клиента получает и короткий прайс, и длинную маркетинговую простыню, прайс проиграет, поэтому источники приводятся к одному формату и объёму до подачи.