Забудьте о GPT-7: что на самом деле выпустила OpenAI
OpenAI не анонсировала новую модель под названием «GPT-7». Вместо этого компания выпустила внушительную коллекцию из 722 математических рукописей, организованных в 372 семейства связанных результатов. Этот релиз, созданный невыпущенной внутренней моделью, напрямую решает около 4000 открытых исследовательских задач.
Широко распространенные спекуляции о «GPT-7» возникли из вирусных догадок, а не из официальных подтверждений OpenAI. OpenAI последовательно называет систему «невыпущенной внутренней моделью», подчеркивая ее текущий статус внутри компании, а не как коммерческий продукт или именованный преемник существующей серии GPT.
Масштаб этой работы важен, потому что она выходит за рамки стандартных бенчмарков. Релиз включает в себя не только утверждения или впечатляющие ответы чат-бота, но и вспомогательные артефакты, такие как формальные доказательства, верифицированные с помощью Lean theorem prover. Это позволяет сторонним исследователям независимо проверять математические утверждения, что знаменует собой значительный сдвиг в сторону верифицируемых открытий, сделанных с помощью машин.
Эта коллекция охватывает широкий спектр математики, включая:
- Теорию чисел
- Геометрию
- Теорию вероятностей
- Теоретическую информатику
- Математическую физику
Средние затраты вычислительных мощностей на один результат составили примерно три часа времени размышлений ChatGPT Pro, преимущественно через одиночные промпты, что является заметным контрастом по сравнению с более ранними, ресурсоемкими подходами, включавшими массивы агентов.
Это были исследовательские вопросы, а не домашнее задание
В отличие от типичных задач из учебников с известными решениями, модель OpenAI взялась за открытые проблемы: вопросы, на которые нет установленных ответов даже среди экспертов. Модель проработала около 4000 таких задач, охватывающих различные математические области.
Эти исследовательские вопросы охватывали:
- Числа
- Геометрию
- Вероятность
- Информатику
- Математическую физику
OpenAI заявляет, что список из 372 семейств результатов не является рейтингом важности, а отражает широту исследований ее внутренней модели.
Сообщаемые результаты значительно различаются. Некоторые из 722 рукописей претендуют на полные решения, в то время как другие описывают частичный прогресс в решении сложных задач. Важно отметить, что некоторые работы представляют контрпримеры, опровергающие давние гипотезы и демонстрирующие глубокое понимание математических границ.
Одно особенно примечательное утверждение, Family 003, касается квазигипотезы Римана. Оно устанавливает область, свободную от нулей для дзета-функции Римана, а именно $\zeta(s) \neq 0$ для $\text{Re}(s) > 7/8$. Важно понимать, что это более слабое утверждение, а не доказательство полной гипотезы Римана, которая остается нерешенной. Исследователи независимо воспроизвели и верифицировали этот конкретный результат с помощью Lean theorem prover.
Доказательство сильнее, чем уверенный ответ
Математическое доказательство требует валидного аргумента, охватывающего каждый возможный случай, а не просто закономерности, сохраняющейся в многочисленных примерах. Проверка правила на тысячах случаев лишь выявляет тенденцию; она не доказывает универсальную истинность правила. Один-единственный контрпример может опровергнуть всю гипотезу, что подчеркивает необходимость строгости.
OpenAI использовала Lean, интерактивный инструмент для доказательства теорем, чтобы формализовать многие этапы доказательств. Lean может проверять эти этапы на соответствие заданным правилам и допущениям, обеспечивая уровень уверенности, выходящий за рамки убедительного текста. Этот проверенный компьютером артефакт предоставляет более веские доказательства, поскольку автоматизированное ядро верифицирует логическую непротиворечивость аргумента.
Не все результаты могут похвастаться доказательствами, проверяемыми компьютером, и даже верифицированная работа требует тщательного изучения, чтобы убедиться, что она действительно доказывает утверждение в рукописи. Консультативная группа по математике и искусственному интеллекту (AGMAI) консультировала по стандартам открытой науки, но ее участие не означает верификацию каждого результата. Более подробную информацию об инициативе см. в разделе Sharing AI Progress in Mathematics - OpenAI.
Например, одно примечательное утверждение, квазигипотеза Римана (семейство 003), постулирует область, свободную от нулей для дзета-функции Римана. Эта более слабая версия знаменитой гипотезы была независимо воспроизведена и подтверждена исследователями с использованием компилятора Lean, что подчеркивает силу формальной верификации в развитии математического понимания.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Настоящий сдвиг заключается в том, как тестируются исследования в области ИИ
OpenAI сообщила, что на каждый успешный результат в среднем уходило около трех часов времени размышления ChatGPT Pro невыпущенной модели. Эта цифра количественно определяет вычислительные усилия этой конкретной внутренней системы для генерации результата, а не гарантию того, что любая потребительская подписка ChatGPT Pro сможет решать открытые исследовательские задачи за три часа работы. Эта цифра также не включает обширные этапы проверки человеком и автоматизированные проверки.
Сравните это с более ранним проектом OpenAI Navier–Stokes, в котором участвовало около 10 000 агентов ИИ, работавших в течение 88 часов. Эти две цифры измеряют разные аспекты вычислительной нагрузки для различных задач и методологий; они не устанавливают прямого ускорения или внезапного скачка в общих возможностях моделей. Разные задачи требуют разных вычислительных стратегий.
Математика и код предлагают необычайно проверяемые полигоны для тестирования рассуждений ИИ, поскольку доказательства могут быть проверены алгоритмически, часто с помощью таких инструментов, как Lean. Это позволяет достичь беспрецедентной строгости при оценке решений, сгенерированных ИИ. Однако успех в этих структурированных областях не доказывает автоматически наличие общего интеллекта или надежной производительности в менее формальных областях, таких как этика, социальные науки или творческое письмо.
Продуктивным вопросом для научного сообщества остается то, смогут ли независимые математики воспроизвести, контекстуализировать и улучшить эти результаты. Этот акцент на проверяемой открытой науке резко контрастирует со спекулятивными заголовками о «GPT-7», которые часто доминируют в новостном цикле, смещая фокус с хайпа на осязаемый, проверяемый прогресс.
Часто задаваемые вопросы
Объявляла ли OpenAI о модели под названием GPT-7?
Нет. В релизе описывается невыпущенная внутренняя модель; GPT-7 — это предположение, а не официальное название.
Что создала эта модель?
OpenAI поделилась 722 математическими рукописями, сгруппированными в 372 семейства результатов, основанными на работе над примерно 4000 исследовательских задач.
Решила ли модель гипотезу Римана?
Нет. В рукописи утверждается более слабый, квази-Риманов результат; полная гипотеза Римана остается нерешенной.
Все ли математические результаты верифицированы?
Нет. Некоторые доказательства имеют проверяемые компьютером артефакты Lean, в то время как другие все еще требуют экспертной оценки и могут содержать ошибки.

