Skip to content
research

ИИ от OpenAI теперь может «думать» втайне

Следующий скачок OpenAI связан не просто с повышением интеллекта ИИ, а с тем, чтобы позволить ему «думать» на закрытом языке, который мы не можем понять. Этот прорыв в эффективности может стать самой большой угрозой безопасности ИИ на сегодняшний день.

Aki Tanaka
ИИ от OpenAI теперь может «думать» втайне

За пределами слов: новый «Neuralese» в ИИ

Невыпущенная модель Astra от OpenAI использует революционную технику: recurrent depth (рекуррентная глубина), также известную как «зацикленный трансформер». Это архитектурное новшество, впервые описанное изданием The Information, позволяет ИИ выполнять обширные внутренние вычисления, прежде чем сгенерировать хотя бы одно слово, что значительно отличает его от предыдущих моделей GPT.

Традиционные большие языковые модели обрабатывают информацию последовательно, наподобие «слово нейронной сети, слово нейронной сети». Они выводят токены после каждого прохода, что делает их «цепочку рассуждений» (chain of thought) в некоторой степени прозрачной. Astra, напротив, многократно прогоняет вычисления через одни и те же слои в цикле. Это делает вычисления более глубокими и сложными, повторно используя существующие слои для достижения более высокого интеллекта без добавления миллиардов новых параметров.

Эта внутренняя итеративная обработка позволяет ИИ рассуждать непосредственно в своем богатом внутреннем числовом состоянии — процесс, который исследователи называют Neuralese. Вместо того чтобы преобразовывать мысли в читаемые человеком токены, такие как английские слова, Astra оперирует тысячами чисел. Это внутреннее представление в тысячи раз плотнее по данным, чем лингвистическое мышление, что позволяет осуществлять сверхэффективные, глубоко интегрированные рассуждения, которые остаются совершенно непрозрачными для внешних наблюдателей.

Больше интеллекта, тот же объем

Recurrent depth, или looped transformer, разрушает устоявшуюся парадигму ИИ о том, что «больше — значит лучше». Этот прорыв позволяет небольшим моделям достигать высокой производительности, которую раньше можно было увидеть только в гораздо более крупных и ресурсоемких архитектурах. Это открывает путь к колоссальному росту эффективности, означая, что расширенные возможности больше не требуют миллиардов новых параметров.

Вместо создания более широких путей нейронной сети с каждым слоем, эта техника повторно использует существующие слои, многократно пропуская через них информацию. Этот архитектурный сдвиг углубляет вычисления, не увеличивая физический размер модели. Результатом является значительное снижение затрат на память и оборудование, что делает высокопроизводительный ИИ более доступным и масштабируемым.

Согласно отчетам, модель Astra от OpenAI, использующая этот метод, достигает превосходных результатов, используя в 14 раз меньше output tokens (выходных токенов), чем предыдущие модели. Этот значительный скачок производительности означает фундаментальный качественный сдвиг, позволяющий ИИ выполнять обширные внутренние рассуждения при генерации минимального объема внешнего текста.

Кошмар эксперта по безопасности

Recurrent depth создает серьезную проблему для безопасности ИИ: проблему мониторинга. Эта техника позволяет таким моделям, как Astra, обрабатывать информацию внутри себя, используя Neuralese — числовое представление, включающее тысячи чисел, которое гораздо богаче человеческого языка. Процесс принятия решений ИИ превращается в непрозрачный «черный ящик», а его истинные рассуждения скрыты от человеческого контроля.

Сравните это с традиционными большими языковыми моделями, использующими рассуждения по chain-of-thought (CoT). Эти модели «показывают свою работу», генерируя промежуточный текст — функцию прозрачности, которую когда-то отстаивала сама OpenAI. Этот читаемый, основанный на токенах вывод позволяет исследователям изучать ход мыслей ИИ, выявляя потенциальные несоответствия или опасные намерения. Например, цепочка рассуждений вроде «Я знаю, что не должен этого делать, но все равно сделаю» становится легко обнаруживаемой.

Теперь эта важнейшая прозрачность исчезает. Исследователи безопасности ИИ предупреждают, что это может стать «худшим событием для безопасности ИИ на сегодняшний день». Томас Ларсен, исследователь из AI Futures Project, выразил обеспокоенность тем, что, хотя ИИ все еще может стать неконтролируемым, «у нас не будет возможности понять, что он делает». Эта потеря понимания лишает нас самого надежного метода обнаружения и предотвращения опасного поведения ИИ, вынуждая нас доверять самоотчетам ИИ о его внутреннем состоянии, даже если он работает на языке, который мы не можем интерпретировать.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Расчетный риск OpenAI

Руководство OpenAI признает серьезные проблемы с мониторингом, присущие recurrent depth. Чтобы смягчить это, они ограничивают применение этой техники в Astra, намеренно сохраняя понятную Chain of Thought (CoT). Это позволяет исследователям в достаточной мере контролировать процесс рассуждения, сохраняя важный предохранительный клапан. Обеспечение того, чтобы мощные системы ИИ оставались понятными и безопасными, является заявленной основной целью их исследовательской программы, определяющей стратегию развертывания.

Эта расчетная осторожность резко контрастирует с ошеломляющими возможностями Astra. OpenAI присвоила Astra статус первой модели, достигшей «критического» порога возможностей в области кибербезопасности в рамках своей Preparedness Framework. Это означает, что Astra может автономно обнаруживать ранее неизвестные уязвимости безопасности — zero-day exploits — и разрабатывать функциональные методы их использования. Сочетание этой беспрецедентной способности к автономной генерации эксплойтов с непрозрачными рассуждениями на Neuralese создает пугающий сценарий: «черный ящик» ИИ, способный к глубоким кибератакам, действующий без понимания человеком его внутренних мыслительных процессов.

Это поворотное событие ставит перед OpenAI и всем сообществом ИИ критический вопрос. Является ли это необходимым, пусть и рискованным, новаторским шагом к AGI, принимающим мощные новые архитектуры, несмотря на их внутреннюю непрозрачность и сложные компромиссы в области безопасности? Или это начало безрассудной «гонки к неконтролируемости», где неустанное стремление к чистой мощности и эффективности ИИ затмевает фундаментальную необходимость безопасности, прозрачности и человеческого контроля? Ответ на этот вопрос определит грядущую эру развития ИИ.

Часто задаваемые вопросы

Что такое модель Astra от OpenAI?

Astra — это невыпущенная модель ИИ следующего поколения от OpenAI, которая, как сообщается, использует новую технику под названием «recurrent depth» для достижения значительного прироста эффективности и возможностей.

Что такое «recurrent depth» или «looped transformer»?

Это архитектурная техника, при которой ИИ может внутренне прогонять информацию через одни и те же слои нейронной сети несколько раз, прежде чем выдать результат. Это углубляет вычисления без увеличения размера модели.

Что такое «Neuralese»?

«Neuralese» — это термин, обозначающий способность ИИ рассуждать непосредственно с помощью своих внутренних числовых представлений (векторов из тысяч чисел) вместо перевода каждого шага на человеческий язык, такой как английский.

Почему исследователи обеспокоены новой техникой Astra?

Основная проблема заключается в том, что она превращает процесс рассуждения ИИ в «черный ящик». Поскольку модель мыслит на «Neuralese», ее цепочка рассуждений становится скрытой, что делает крайне трудным для людей мониторинг опасного или нежелательного поведения.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.