Исследование показывает, что современные LLM сильно переобучаются на конкретных наборах данных, включая экзаменационные вопросы, что влияет на их поведение и память. Также выявлено появление самоисправляющегося поведения моделей начиная с GPT-4.1, связанного с обучением на reasoning data. Это важно для ответственного и эффективного использования данных при предобучении.
⚡️ Reverse Engineering OpenAI's Training Data — Pratyush Maini, Datology
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение и контекст
Pratyush Maini из Dtology рассказывает о своей работе и страсти к анализу данных в AI. Он подчеркивает, что данные остаются недооценённым аспектом в исследованиях и разработках моделей.
Команда Dtology ведет канал "data is weird", где делятся необычными артефактами из датасетов, показывая, насколько странными и неожиданными могут быть данные из интернета.
Тема диссертации и проблемы данных
Основная тема — как эффективно использовать большие, но шумные веб-данные для обучения моделей, при этом учитывая вопросы ответственности, например, атрибуции авторства и безопасности.
Pratyush акцентирует внимание на необходимости балансировать между производительностью моделей и этическими аспектами данных.
Переобучение на экзаменационных данных
Модели, включая Cohere, показывают, что они буквально запоминают вопросы и варианты ответов из экзаменов, что свидетельствует о переобучении на этих данных.
Это подтверждается тем, что модели могут продолжить вопрос по первым словам, что невозможно без многократного повторения этих данных в обучении.
Самоисправляющееся поведение моделей
При вопросе о существовании seahorse emoji модели, включая GPT и Grock, начинают выдавать противоречивые, цикличные ответы, демонстрируя внутренний конфликт.
Это явление связано с обучением моделей на reasoning data и появляется начиная с GPT-4.1, что указывает на развитие способности к самокоррекции и рефлексии в генерации текста.
Эволюция и причины поведения моделей
Модели до декабря 2024 года не демонстрировали такого самоисправляющегося поведения, оно появилось с выходом GPT-4.1 и усилилось в GPT-5.
Это связано с обновлениями и дополнительным обучением на reasoning traces, что влияет на длину и сложность ответов моделей, а также на их способность к внутреннему анализу.