← Все статьи

OpenAI выложила почти 400 математических результатов от ИИ: что известно о проверке и какое правило взять себе, когда ИИ выдаёт много сразу

Темы: Наука, ИИ

Из светящегося куба слева выходит поток листов с геометрическими фигурами; справа на нескольких столах с лампами лежат маленькие стопки, и лишь на некоторых листах стоят зелёные круглые отметки

Короткий ответ: по материалу The Verge, в октябре 2026 года OpenAI выложила почти 400 созданных ИИ математических результатов в более чем 700 рукописях. Более трёх десятков математиков, с которыми говорило издание, описывали произошедшее словами вроде «ошеломляюще» и «беспрецедентно» а исследователи, как пишет издание, сходились в том, что одно лишь понимание выложенного может занять годы. Главные результаты формализованы, то есть записаны в языке Lean для компьютерной проверки, в 300 из 719 рукописей, около 42%, и OpenAI признаёт, что результаты находятся на разных стадиях проверки. Это не число подтверждённых результатов: надо ещё проверять, что формализация доказывает заявленное. К 8 октября компания убрала три статьи из-за ошибки знака. Мнения о качестве расходятся: одни математики говорят о работе очень высокого уровня, другие жалуются на трудночитаемые тексты. Для любой работы с ИИ из этого следует правило: если он выдаёт много результатов сразу, главным ограничением становится проверка. Ниже факты, мнения и три шага.

Что опубликовано

Все факты ниже взяты из материала The Verge; репозиторий OpenAI я не открывал.

  • Объём. Почти 400 результатов в более чем 700 рукописях по комбинаторике, геометрии, теории чисел, теоретической информатике, алгебре, топологии, вероятности и статистической механике, математической физике. Оглавление с аннотациями занимает около 40 страниц, и у нескольких математиков только на его чтение около часа.
  • Как OpenAI это получила. Модель пробовала больше 4000 задач, на типичный результат ушло около трёх часов вычислений на «размышление» в ChatGPT Pro. Модель, запросы и полный список задач компания не раскрыла.
  • Как проверяют. Часть рукописей сопровождают формализации в Lean: это язык, в котором доказательство проверяет компьютер. Но, по словам математиков, надо ещё убедиться, что формализация доказывает именно то, что заявлено в тексте, а качество неровное и формулировки не всегда совпадают с заявленным.
  • Чего не хватает. По данным OpenAI, формализованы главные результаты в 300 из 719 рукописей, около 42%. Для остальных 419 рукописей материал формализации главных результатов не называет и не говорит, как их проверили иначе. Формализация, в свою очередь, не отменяет проверки того, что она доказывает заявленное.
  • Исправления. К 8 октября в журнале исправлений OpenAI были правки более чем двенадцати рукописей и удаление трёх из-за ошибки знака, которая, по словам компании, делает рассуждение неверным.

Что говорят математики

  • О качестве работы. Ряд исследователей считает, что уровень очень высокий, несмотря на слабую подачу. По мнению некоторых, до эпохи ИИ многие результаты заслуживали бы публикации в ведущих журналах, а единицы могли бы сделать автора претендентом на Филдсовскую премию, одну из высших наград в математике. Стэнфордский математик Джаред Дакер Лихтман назвал «десятки» таких результатов, среди них продвижение к гипотезе Римана, частный случай гипотезы Ходжа и решение четырёхмерной гипотезы Какэя. Это его мнение, не подтверждённое проверкой.
  • О текстах. Математик из Brown Брэндан Хассетт сказал, что запись по задаче, которую он знает лучше всего, после беглого чтения почти не имела смысла. Он говорил это до отзыва трёх статей. Прежние публикации OpenAI по математике эксперты критиковали, в частности, за слабое указание источников.
  • О проверке. Кевин Бьюзард из Imperial College London выделил в своей области около шести теорем и сказал, что ему приходится либо читать возможно неверные тексты, либо ждать, пока их проверят другие или формализуют.
  • О последствиях. Некоторые исследователи рассказали, что у коллег планы и заявки на гранты обесценились: Скотт Армстронг знает о группе, программа которой практически «стёрта», Тристан Бакмастер слышал о трёх людях в такой ситуации.
  • О значении. Константин Коглер из Института перспективных исследований назвал это самым важным моментом в истории математики, а Ян-Хуэй Хэ сравнил события этого года с публикацией «Начал» Евклида. Большинство математиков высказывалось менее категорично.

OpenAI, по материалу, раскрыла больше сведений, чем в прошлые разы, и ведёт журнал правок. Консультативная группа математиков советовала выпускать статьи, которые понимает человек, формализовать доказательства и раскрывать модели и запросы; OpenAI выполнила часть этих советов, но не назвала модель и запросы. Компания пообещала финансировать семинары и конференции без подробностей и заявила, что будет улучшать качество статей.

Я не оцениваю, верны ли сами результаты: для этого нужна проверка специалистов.

Три правила для тех, кто получает от ИИ много результатов сразу

Это мои выводы из описанного случая, а не слова математиков.

  1. Заранее решить, что считается проверенным. В этой истории есть несколько разных состояний: «создано ИИ», «формализовано» (записано для компьютерной проверки), «соответствие формализации заявленному проверено» и «правильность подтверждена специалистом». Прочитанное и понятое человеком не равно подтверждённому. Статус надо писать рядом с каждым результатом.
    • Кто делает: тот, кто принимает работу от ИИ.
    • Чем проверить: в таблице результатов есть столбец «статус проверки» с одним из этих значений, и пустых ячеек нет.
  2. Не публиковать то, что нельзя проверить за разумное время. Если проверка одного результата занимает часы, а результатов сотни, очередь на проверку может расти, если новые результаты приходят быстрее, чем их проверяют.
    • Кто делает: руководитель.
    • Чем проверить: оцените время проверки по двум-трём результатам и умножьте на их число до начала работы. Если получается больше, чем у вас есть времени, берите меньшую партию.
  3. Вести журнал исправлений. OpenAI это делает, и журнал уже показал отзыв трёх статей.
    • Кто делает: тот, кто публикует результаты.
    • Чем проверить: каждая правка записана с датой и причиной, прежняя версия сохранена, а читатель может найти журнал за минуту.

Расчёт на условных числах

Пусть на проверку одной рукописи человеку нужно в среднем 2 часа: это условная цифра, источник её не называет. Тогда для 719 рукописей выходит 1438 часов, то есть около 36 рабочих недель по 40 часов одного специалиста. Для вашего бизнеса пример тот же: если ИИ подготовил сто договоров, отчётов или расчётов, а проверка каждого занимает полчаса, то проверка займёт 50 часов. Подставьте свои числа и сравните с тем, сколько времени у вас есть.

Когда это вас не касается

Если вы просите ИИ написать пару писем или одну таблицу, проверить результат можно сразу. Правила выше нужны, когда результатов много и ошибка в одном незаметна среди остальных.

Итог

В октябре 2026 года OpenAI выложила почти 400 созданных ИИ математических результатов в более чем 700 рукописях. Главные результаты формализованы в 300 из 719 рукописей, около 42%; три статьи убраны, мнения математиков расходятся от «очень высокого уровня» до «трудно читать». Верны ли сами результаты, я не оцениваю. Для тех, кто работает с ИИ, главное из этого случая: проверка становится узким местом, поэтому статус проверки надо писать рядом с результатом, партию подбирать по времени проверки и вести журнал исправлений.

Я занимаюсь ИИ-агентами и автоматизацией. Если хотите посмотреть мои проекты или обсудить свою задачу, загляните в портфолио.

Источники