Математика как тренажёр самопроверки и мера длины рассуждения
Разбор беседы с исследователями о том, как модели за считанные годы прошли путь от неспособности к простым вычислениям до решения задач исследовательского уровня. Математика в этом рассказе — не цель, а тренажёр: доказательство на десятки страниц рушится от одной ошибки в середине, поэтому обучение на таких задачах прежде всего вырабатывает самопроверку. Вводится и мера прогресса — насколько долго система способна удерживать связное рассуждение, не теряя нить.
ИИ прошёл путь от неспособности к сложению до золотой медали IMO за 2 года; ключ — математика как полигон для
К подряду отсюда ведёт одна ниточка, зато важная: система устойчиво держит рассуждение только до определённой длины, дальше теряет нить. Значит, задачу агенту резать на куски с проверяемым результатом на каждом, а не отдавать целиком «сделай бота под ключ» и надеяться. Это же объясняет, почему длинные прогоны конвейера разваливаются в середине — дело не в модели, а в размере куска.