← Материалы разборы Yersham
разбор · данныебалл 8.0#269 из 823 · 2026-02-25

Исследование показывает, что современные LLM сильно переобучаются на конкретных наборах данных, включая экзаменационные вопросы, что влияет на их поведение и память. Также выявлено появление самоисправляющегося поведения моделей начиная с GPT-4.1, связанного с обучением на reasoning data. Это важно для ответственного и эффективного использования данных при предобучении.

⚡️ Reverse Engineering OpenAI's Training Data — Pratyush Maini, Datology

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Можно применять для построения оркестрации моделей с учетом качества и происхождения данных, автоматизации фильтрации и оценки обучающих наборов, а также для настройки агентов с механизмами самокоррекции и мониторинга переобучения.

карта разбора · 5 ветокклик по цифре — раскрыть главу
суть01Введение и контекст02Тема диссертации и…03Переобучение на экз…04Самоисправляющееся…05Эволюция и причины…

наведи и нажми на цифру — раскроется глава

полный разбор ролика · 5 глав
01

Введение и контекст

Pratyush Maini из Dtology рассказывает о своей работе и страсти к анализу данных в AI. Он подчеркивает, что данные остаются недооценённым аспектом в исследованиях и разработках моделей.

Команда Dtology ведет канал "data is weird", где делятся необычными артефактами из датасетов, показывая, насколько странными и неожиданными могут быть данные из интернета.

02

Тема диссертации и проблемы данных

Основная тема — как эффективно использовать большие, но шумные веб-данные для обучения моделей, при этом учитывая вопросы ответственности, например, атрибуции авторства и безопасности.

Pratyush акцентирует внимание на необходимости балансировать между производительностью моделей и этическими аспектами данных.

03

Переобучение на экзаменационных данных

Модели, включая Cohere, показывают, что они буквально запоминают вопросы и варианты ответов из экзаменов, что свидетельствует о переобучении на этих данных.

Это подтверждается тем, что модели могут продолжить вопрос по первым словам, что невозможно без многократного повторения этих данных в обучении.

04

Самоисправляющееся поведение моделей

При вопросе о существовании seahorse emoji модели, включая GPT и Grock, начинают выдавать противоречивые, цикличные ответы, демонстрируя внутренний конфликт.

Это явление связано с обучением моделей на reasoning data и появляется начиная с GPT-4.1, что указывает на развитие способности к самокоррекции и рефлексии в генерации текста.

05

Эволюция и причины поведения моделей

Модели до декабря 2024 года не демонстрировали такого самоисправляющегося поведения, оно появилось с выходом GPT-4.1 и усилилось в GPT-5.

Это связано с обновлениями и дополнительным обучением на reasoning traces, что влияет на длину и сложность ответов моделей, а также на их способность к внутреннему анализу.

#данные#переобучение#самокоррекция#оркестрация
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы