8 октября 2026 года OpenAI опубликовала 719 рукописей с решениями сложных математических задач. Компания заявила, что консультировалась с группой математиков-экспертов, чтобы не повторить резонанс вокруг прошлого заявления о давней нерешённой задаче. Короткий ответ на вопрос из заголовка: нет, стандартам математического сообщества этот пакет пока не соответствует. Проблема не в том, что задачи не решены, а в том, что проверить и осмыслить решения по принятым в математике правилам нельзя.
Три числа описывают разрыв лучше любых оценок. Из 719 рукописей только 10 содержат цепочку рассуждений модели. У 42% доказательств не проводилась формализация. Оба показателя приведены в разборе релиза в TechCrunch, где сопоставлены заявления OpenAI и рекомендации консультативной группы математиков.
Цепочка рассуждений это пошаговая запись того, как модель пришла к результату. Без неё нельзя понять, вывел ли ИИ ответ логикой или подобрал его. Формализация это перевод доказательства на язык, который проверяется машинно. Без неё доказательство остаётся текстом на естественном языке, читать который должны люди.
Рекомендации, о которых идёт речь, выпустила AGMAI (Advisory Group on Mathematics and Artificial Intelligence), консультативная группа при Принстонском институте перспективных исследований. В неё входят девять видных исследователей из разных стран. Документ появился в конце сентября 2026 года, за считаные дни до публикации OpenAI.
Что именно выпустила OpenAI и почему это вызвало вопросы
Релиз позиционировался как демонстрация исследовательского уровня моделей: сотни рукописей с решениями задач, которые до сих пор оставались открытыми. Формально компания выполнила пожелание математиков о консультациях. Фактически вопросы вызвали не сами ответы, а обвязка вокруг них: прозрачность и проверка.
Ключевые цифры релиза: 719 рукописей, 10 цепочек рассуждений, 42% без формализации
Числа, о которых спорят, выглядят так. Всего 719 рукописей. Цепочку рассуждений модели раскрывают 10 из них. У 42% доказательств формализация не проводилась.
Смысл цепочки рассуждений в том, что она позволяет независимому читателю пройти путь модели и найти ошибку. Когда из 719 работ такая выкладка есть только у 10, читателю предлагается поверить на слово остальным 709. Для математики это неприемлемая сделка: здесь ценность несёт и ответ, и способ его получения, поскольку из метода вырастают новые теоремы и обобщения.
Формализация решает другую задачу. Она превращает текст в объект для машинной проверки. 42% доказательств этот этап не прошли, то есть остались вне формальной верификации. Складывая показатели, получаем картину релиза: почти все решения существуют в виде текста, который нужно читать людям, а людей, способных это сделать, в мире единицы.
Насколько глубоко модели продвинулись в математике к 2026 году, разобрано в отдельном материале: AI и математика: где проходят реальные границы возможностей моделей.
Позиция Теренса Тао и Мелани Вуд: отсутствие человеческого понимания
Теренс Тао, один из самых цитируемых математиков современности, отреагировал на релиз резко. В соцсетях он описал ситуацию, в которой задачи решают автономно AI-промптеры, теряющие интерес к теме, как только цель помечена как решённая.
«Задачи решаются автономно AI-промптерами, которые не интересуются самой областью, как только их исходная цель "решена", и не понимают вывод ИИ достаточно хорошо, чтобы отвечать на вопросы о результате, читать доклады или иначе взаимодействовать с остальной частью области». Теренс Тао, после релиза OpenAI
Мелани Вуд упоминается среди математиков, которые указывают на отсутствие человеческого понимания результата и ответственности сообщества за него. Здесь стоит обозначить ограничение: в доступном фрагменте первоисточника её формулировки не приводятся, поэтому передать её позицию дословно нельзя.
Претензия Тао и Вуд касается природы математического знания. Теорема становится частью науки, когда её понимают, обсуждают, применяют и могут поручиться за неё. Правильный ответ без носителя понимания остаётся чёрным ящиком.
Рекомендации AGMAI: что предлагают математики и что выполнено
AGMAI выпустила документ с рекомендациями для передовых лабораторий в конце сентября 2026 года. В заявлении по новому релизу OpenAI группа указала: «Окончательная оценка того, насколько успешно выполнены наши рекомендации, остаётся за математическим сообществом».
Первая рекомендация: прекратить тестирование на проприетарных моделях
Первым пунктом AGMAI попросила остановить тестирование сложных математических задач на проприетарных моделях. Логика простая: закрытая модель не даёт воспроизводимости. Если результат нельзя повторить на другом железе или хотя бы заново прочитать тот же ход рассуждений, сообщество не может ни проверить, ни опровергнуть вывод.
Релиз OpenAI прямо противоречит этому пункту. В нём сказано, что компания оценивает свои проприетарные модели на открытых исследовательских задачах по математике, о чём говорится и в описании релиза. Открытость задач здесь не заменяет открытость модели, поскольку результат определяет именно поведение модели.
Формализация нерешённых доказательств и финансирование математиков
Второй блок рекомендаций касался доказательств, которые люди не понимают. Такие работы AGMAI предложила формализовать, чтобы корректность проверялась машинно, а не только чтением. Третий пункт: OpenAI стоит помочь финансировать труд математиков, которые потребуются, чтобы решения лаборатории стали значимыми в реальном смысле.
По обоим пунктам результат частичный. Формализация выполнена для части релиза, 42% доказательств её не прошли. Цепочку рассуждений модели раскрывают только 10 рукописей из 719. Сведений о том, взяла ли OpenAI на себя финансирование работы независимых математиков, в доступных материалах нет.
Отдельная деталь: AGMAI не ответила на запрос TechCrunch с более тщательной оценкой релиза OpenAI. Неясным остаётся и то, берёт ли OpenAI на себя ответственность за человеческое понимание опубликованных доказательств, как того требуют рекомендации.
Формализация на Lean: как работает верификация и где она даёт сбои
Когда ИИ-модель решает математическую задачу, она сначала строит объяснение на естественном языке, а затем пытается выразить результат на Lean, языке программирования, который по замыслу подтверждает точность доказательства через компиляцию кода. Так этот конвейер описан в публикации о релизе.
Что такое Lean и зачем он нужен для верификации ИИ-доказательств
Lean это система формального доказательства (proof assistant): среда, в которой доказательство записывают формально, а корректность каждого шага проверяет компилятор. Если код собирается, значит при заявленных определениях и аксиомах противоречий нет. Для ИИ-доказательств это удобный инструмент, поскольку он не требует доверия к языковой модели: проверяет не автор, а программа.
Слабое место находится в другом месте. Компилятор проверяет формальную формулировку, а не её соответствие исходной задаче. Если по дороге условие ослаблено, определение подменено или в код закралась неоговорённая предпосылка, Lean этого не заметит: он честно подтвердит, что доказано именно то, что записано. Сопоставить запись с исходным смыслом может только человек, разбирающийся в предмете.
Расхождения в задаче по уравнениям Навье-Стокса: кейс Кембриджа и Королевского колледжа
Пример такого разрыва дала работа математиков из Кембриджского университета и Королевского колледжа Лондона. Они разбирали задачу, связанную с уравнениями Навье-Стокса, и задокументировали как минимум два расхождения между доказательством на естественном языке и его формализацией на Lean.
Это означает простую вещь: скомпилированный Lean-код сам по себе не служит доказательством того, что решена исходная задача. Автоматическая верификация закрывает синтаксис и логику формальной записи, а связку между записью и постановкой задачи держит человек. Пока эту связку никто не проверил, формализация создаёт ощущение надёжности, которого может не быть.
Ограничение, которое стоит держать в голове: полного текста этой работы в доступных материалах нет, поэтому конкретные расхождения и их масштаб не раскрыты. Речь идёт о факте расхождений, а не об их детальной картине.
Человеческое понимание и ответственность: чего не хватает ИИ-решениям
Критика Тао и Вуд касается не техники, а устройства науки. Математика работает как социальная система: результат признают, когда его поняли коллеги.
Почему математикам мало правильного ответа
Научная работа проходит рецензирование, доклады на семинарах, проверку независимыми группами. Автор должен уметь ответить на вопросы, объяснить шаг, который вызывает сомнение, переписать доказательство в новых обозначениях. Если автора в этом смысле нет, а есть только вывод модели, обсуждение превращается в пересказ чёрного ящика.
Тао описал этот разрыв точно: промптеры, запустившие модели, не понимают вывод достаточно хорошо, чтобы отвечать на вопросы о результате, читать доклады или иначе взаимодействовать с остальным сообществом. Формально задача закрыта, фактически знание не появилось.
Ответственность здесь не бюрократическая формальность. За доказанной теоремой в математике стоит конкретный человек, который готов её защищать. У ИИ-решений такого носителя нет, и потому сообщество не может включить результат в корпус знания, даже если ответ верен.
Роль AGMAI и призыв финансировать математиков
AGMAI предложила OpenAI оплачивать работу математиков, которые сделают решения лаборатории значимыми: формализуют их, проверят и осмыслят. Это признание того, что без человеческого звена релиз остаётся набором непрочитанных файлов.
Группа работает при Принстонском институте перспективных исследований и объединяет девять исследователей. Её заявление по новому релизу сдержанно: оценка выполнения рекомендаций отдана сообществу. Фактически соответствие стандартам будут устанавливать не пресс-релизом, а рецензированием и временем.
Практические выводы: можно ли доверять ИИ-решениям математических задач
Модели решают задачи, которые раньше были открытыми, и это факт. Доверять их выводам без проверки нельзя, и вот почему: 42% доказательств из релиза OpenAI не прошли формализацию, а цепочка рассуждений раскрыта только в 10 работах из 719.
Как проверять ИИ-доказательства: чек-лист для практика
- Требуйте цепочку рассуждений. Пошаговая выкладка это единственный способ увидеть, где модель могла ошибиться или подогнать ответ. 10 рукописей из 719 показывают, что по умолчанию этого не дают.
- Смотрите, формализовано ли доказательство и в какой системе: Lean, Coq, Isabelle. Отсутствие формализации означает, что проверка упирается в чтение людьми.
- Сверяйте формальную постановку с исходной задачей. Компиляция подтверждает корректность записи, а не её совпадение с вопросом, на который нужен ответ.
- Подключайте математика-эксперта в предметной области. Кейс Кембриджа и Королевского колледжа Лондона с уравнениями Навье-Стокса показал, что расхождения между текстом и Lean-кодом реальны.
- Оценивайте прозрачность модели заранее. Если поведение системы нельзя воспроизвести публично, ценность результата для вас падает, даже когда ответ выглядит верным.
- Сверяйтесь с рекомендациями AGMAI: они задают минимальную планку для лабораторий, публикующих математические результаты.
Будущее ИИ в математике: сотрудничество, а не замена
Разбираемый случай показывает рабочую схему: модель генерирует кандидаты решений, человек проверяет, формализует и берёт ответственность. AGMAI предлагает подкрепить эту схему финансированием труда математиков, без которых релизы остаются сырыми.
Отдельный сюжет этого конфликта про приоритет, доступ к данным и этику лабораторий разобран в материале о скандале вокруг OpenAI и задачи Навье-Стокса. Там видно, что спор идёт о математике и о правилах игры в ИИ-исследованиях одновременно.
Что делать читателю, который применяет ИИ в работе с формулами и моделями: относиться к выводам моделей как к гипотезам, требовать выкладку и проверку, а не принимать их как готовое знание. Ускорение на этапе генерации идей реально. Замена рецензирования и человеческого понимания на компилятор пока не работает: 42% неформализованных доказательств и два расхождения в одном кейсе это показывают.