Skip to content
research

Astra: ИИ умнее, чем обладатель степени PhD?

Новая модель OpenAI только что решила 10 сложных математических задач, но суть не в самих ответах. Главное — это революционный метод самопроверки, который она использовала, и то, что это означает для будущего решения сложных задач.

Aki Tanaka
Astra: ИИ умнее, чем обладатель степени PhD?

10 задач, один ИИ, ноль доверия к человеку

Компания OpenAI недавно объявила о значительном прорыве: внутренняя версия их следующей крупной модели, Astra, успешно решила десять сложных задач по математике и теоретической информатике. Это достижение, подробно описанное в публикации под названием «десять достижений в математике и теоретической информатике», по-настоящему впечатлило экспертов, некоторые из которых предположили, что возможности Astra теперь превосходят уровень человека со степенью PhD.

OpenAI подкрепила эти заявления подробным 249-страничным отчетом, доступным для публичного ознакомления. Этот документ включает в себя внушительные 62 страницы рассуждений, сгенерированных самой моделью для поиска решений. Важно отметить, что каждый результат был тщательно написан на Lean — языке формальной верификации, который позволяет компьютеру проверять каждую строку, обеспечивая достоверность без необходимости в человеческой интерпретации или доверии.

Эта строгая валидация решает прошлые противоречия и позиционирует производительность Astra как эталон «долгосрочного» рассуждения. В отличие от моделей, эффективных в быстрых, изолированных задачах, Astra спроектирована для работы над одной проблемой в течение часов или дней, сохраняя устойчивую логическую последовательность. Способность не терять нить рассуждений и не повторять ошибки в течение длительного времени представляет собой серьезный барьер для современного ИИ, подчеркивая продвинутую способность Astra к комплексному многоэтапному решению задач.

Доказательства, а не обещания: внутри машины Lean

Заявления Astra подкреплены беспрецедентным уровнем проверяемости. OpenAI написала каждый результат на Lean, языке формальных доказательств. Здесь компьютерный компилятор, а не человек, изучает каждую строку математического аргумента. Если код Lean компилируется, доказательство является неопровержимо верным, давая окончательный ответ «да» или «нет» относительно математической обоснованности.

Этот строгий подход напрямую решает проблемы прошлых ошибок. В октябре прошлого года OpenAI столкнулась с критикой, когда GPT-5 ошибочно приписали решение десяти ранее нерешенных задач Эрдёша. Оказалось, что модель просто нашла уже существующие решения, предложенные людьми. Этот инцидент подчеркнул критическую необходимость независимой проверки, выходящей за рамки простых утверждений.

Сегодняшний метод представляет собой значительный сдвиг парадигмы в исследованиях ИИ. Мы больше не полагаемся на заявления в духе «поверьте нам»; вместо этого акцент делается на «проверьте сами». Это отражает практику разработки программного обеспечения, где разработчики запускают модульные тесты для проверки функций кода. Lean обеспечивает такую же машинную гарантию, превращая математические выводы ИИ из «черного ящика» в прозрачные, проверяемые факты. Эта приверженность доказуемой корректности создает необходимую уверенность в возможностях Astra.

Агентный рой: секретное оружие Astra

Архитектура Astra использует инновационный дизайн агентного роя (agentic swarm). Корневой агент берет на себя роль менеджера проекта, тщательно разбивая основную задачу на отдельные подзадачи. Затем он стратегически делегирует эти специализированные подзадачи отдельным субагентам, каждый из которых фокусируется на своем конкретном задании, прежде чем синтезировать их результаты в комплексное, единое решение.

Этот распределенный подход, хотя и кажется эффективным, создает критическую проблему: накладные расходы на координацию. Общий успех системы зависит от тонкого баланса, при котором выгода от разделения сложной работы должна явно перевешивать неизбежные затраты на управление взаимодействием агентов и синтез разнообразных результатов. Если эти накладные расходы — аналогичные проблемам коммуникации и интеграции в большой команде людей — становятся слишком высокими, преимущества параллельной обработки могут исчезнуть.

Такая архитектура имеет глубокие последствия для реальной разработки программного обеспечения, выходящие за рамки теоретической математики. Система, способная сохранять неизменную концентрацию на сложной задаче в течение нескольких дней, не «теряясь» и не повторяя ошибок, могла бы произвести революцию в управлении проектами, например, при организации масштабного рефакторинга кода. Это позволило бы избежать распространенной человеческой ошибки — потери контекста или повторного внесения исправленных багов в огромную кодовую базу. Для получения дополнительной информации о десяти достижениях в области математики и теоретической информатики, которых добилась Astra, ознакомьтесь с официальным анонсом OpenAI: Ten Advances in Mathematics and Theoretical Computer Science - OpenAI.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Вопрос на $2,000: является ли интеллект товаром?

Заявленная стоимость успешных математических прорывов Astra сигнализирует о глубоком сдвиге в интеллектуальной экономике. OpenAI утверждает, что десять проверенных решений обошлись примерно в $2,000 в виде кредитов API. Этот шокирующе низкий ценник для задач, которые годами ставили в тупик экспертов-людей, заставляет переосмыслить ценность, намекая на будущее, где интеллект высокого уровня становится доступным, даже дешевым товаром, а не дефицитным ресурсом.

Важно отметить, что эта цифра в $2,000 учитывает только успешные запуски. Фактические вычислительные затраты, которые включают потенциально сотни или тысячи неудачных попыток, предшествовавших каждому прорыву, остаются полностью неизвестными. Поскольку Astra является внутренней моделью OpenAI, ни один внешний аудитор не может проверить истинную совокупную стоимость, что затрудняет полную контекстуализацию заявлений об эффективности.

Математик Томас Блум предлагает важный контраргумент к нарративу о том, что «ИИ заменит людей», утверждая, что Astra функционирует как сложный инструмент, а не как замена. Он подчеркивает глубокую зависимость модели от человеческой изобретательности:

  • Она решает гипотезы, выдвинутые математиками.
  • Она использует теорию, разработанную математиками на протяжении столетия.
  • Это ИИ, созданный математиками.
  • Она была обучена на чтении всего, что когда-либо было написано математиками.

Эта перспектива представляет Astra как ускоритель, созданный самой областью, которую она теперь развивает, а не как независимую замену.

Часто задаваемые вопросы

Что такое OpenAI Astra?

Astra — это внутренняя ИИ-модель нового поколения от OpenAI, специально разработанная для сложных долгосрочных задач, таких как передовые математические исследования.

Как были проверены математические решения Astra?

Решения были написаны на Lean, языке формальных доказательств. Компьютерный компилятор проверяет логику строка за строкой, гарантируя математическую корректность доказательств без необходимости человеческого доверия или проверки.

Чем Astra отличается от моделей вроде GPT-4?

Astra спроектирована для выносливости и способна работать над одной задачей часами или днями. Она использует многоагентную архитектуру для поддержания согласованности и управления сложностью с течением времени, в отличие от моделей, оптимизированных для коротких диалоговых задач.

Заменяет ли Astra математиков?

Не напрямую. Эксперты рассматривают его как мощный инструмент, который дополняет работу исследователей-людей, беря на себя решение сложных доказательств. Он опирается на вековой опыт теоретических разработок и был создан математиками, выступая в роли соавтора, а не замены.

Сколько стоило решение этих задач?

OpenAI сообщила, что успешные попытки обошлись примерно в 2000 долларов вычислительных мощностей по их тарифным ставкам API. Однако эта цифра не включает стоимость неудачных запусков, поэтому общая стоимость исследований и разработок остается неизвестной.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only