Skip to content
research

«Личные мысли» ИИ только что утекли

Лаборатории ИИ создали цифровое хранилище, чтобы скрыть секретные рассуждения своих моделей. Исследователи только что нашли мастер-ключ, и он был у всех на виду.

Aki Tanaka
«Личные мысли» ИИ только что утекли

Форт-Нокс, которого не было

Внутренняя цепочка рассуждений (chain-of-thought, CoT) ИИ представляет собой проприетарный «секретный ингредиент», который крупные лаборатории тщательно оберегают. Это пошаговое рассуждение, критически важное для раскрытия продвинутых возможностей и поддержания конкурентного преимущества, является ключевой интеллектуальной собственностью. Лаборатории разработали свои API-ответы так, чтобы предотвратить прямой доступ к ним, защищая эти ценные мыслительные процессы от конкурентов.

Для защиты этой CoT API возвращал непрозрачный зашифрованный «блок» рассуждений. Этот нечитаемый набор данных служил «черным ящиком»: пользователи могли передавать его обратно модели для контекста в последующих запросах, обеспечивая непрерывный диалог без раскрытия сложного мыслительного процесса внутри. Механизм был нацелен на то, чтобы только исходный провайдер модели мог интерпретировать и безопасно повторно использовать эти зашифрованные данные, не позволяя конкурентам проводить обратную разработку их моделей.

Однако эта якобы надежная система безопасности содержала фундаментальный проектный дефект, превративший ее Форт-Нокс в решето. Зашифрованный блок рассуждений был универсальным, он не был уникально привязан к конкретному пользователю, отдельной сессии или даже к той мощной модели, которая его сгенерировала. Этот архитектурный просчет создал единственную критическую уязвимость: общий ключ дешифрования для всего семейства моделей. Это позволило «личным мыслям» дорогих, защищенных моделей стать универсально расшифровываемыми их более дешевыми и менее защищенными «младшими братьями», полностью обходя задуманную защиту.

Взлом хранилища ключом «младшего брата»

Исследователи разработали атаку с повторным воспроизведением между моделями (cross-model replay attack), чтобы обойти проприетарное шифрование, защищающее внутренние рассуждения моделей ИИ. Они начали с подачи запросов мощным моделям, таким как Claude Opus или GPT-4, которые возвращали свою сложную цепочку рассуждений в виде непрозрачного зашифрованного блока. Этот «набор данных» был спроектирован как нечитаемый, но необходимый для поддержания контекста между запросами.

Гениальный шаг заключался в подаче этого же самого зашифрованного блока без изменений меньшей, менее защищенной модели-«родственнику» из того же семейства провайдера. Например, зашифрованный след от Claude Opus 4.8 можно было напрямую воспроизвести в Claude Haiku. Эта архитектурная уязвимость означала, что блок принимался универсально, что указывало на общий ключ шифрования для целых семейств моделей.

Важно отметить, что такие меньшие модели, как Haiku, значительно легче подвергаются джейлбрейку (jailbreak) с помощью простых разрешающих промптов. Исследователи воспользовались этой сниженной защищенностью, обманом заставив более слабую модель расшифровать личные мысли мощной модели и раскрыть их в виде открытого текста. Это фактически превратило «младшего брата» в невольного декодера, сделав исходное шифрование бесполезным и раскрыв проприетарные рассуждения.

Что скрывалось в тени

Исследователи не просто заглянули во внутренний монолог ИИ; они организовали полномасштабное извлечение данных. С помощью своей атаки с повторным воспроизведением между моделями (cross-model replay attack) они систематически декодировали поразительные 315 320 блоков рассуждений (reasoning blocks) из публично доступных репозиториев кода. Это была не утечка, а настоящий поток ранее скрытой информации.

Среди этих восстановленных следов содержались крайне конфиденциальные данные, полностью невидимые для исходных пользователей. Анализ выявил 367 случаев раскрытия персональных данных (PII) и 182 скомпрометированных учетных данных, включая 62 API-ключа и 33 уникальных пароля. Это продемонстрировало глубокое нарушение предполагаемой конфиденциальности.

Эта уязвимость открывает путь к четырем различным и мощным векторам атак:

  • Кража интеллектуальной собственности, позволяющая конкурентам извлечь проприетарные алгоритмы мышления ИИ.
  • Масштабное извлечение частных данных, сбор конфиденциальной информации пользователей.
  • Раскрытие отфильтрованного вредоносного контента, обнажающее то, что модели были запрограммированы скрывать.
  • Невидимая инъекция промптов (prompt injection), манипулирующая поведением ИИ без ведома пользователя.

Для получения более подробной технической информации об этих выводах ознакомьтесь с исследовательской работой Stealing Reasoning Traces from Proprietary LLM APIs - arXiv.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Патч выпущен, но урок усвоен

Новости о cross-model replay attack быстро распространились в технологическом сообществе. Подробная исследовательская работа, описывающая этот новый метод взлома (jailbreak) с дешифровкой, который раскрыл более 315 000 блоков рассуждений, вызвала бурную дискуссию. Она набрала почти 700 баллов и сотни комментариев на Hacker News, подчеркивая широкую обеспокоенность по поводу безопасности моделей ИИ и обработки данных.

После ответственного раскрытия информации исследователями крупные провайдеры ИИ оперативно устранили уязвимость. Anthropic, OpenAI и Google признали наличие проблемы и подтвердили, что развернули патчи для защиты своих моделей от этого конкретного вектора атаки. Эти быстрые действия помогают снизить непосредственные риски, связанные с обнаруженным методом.

Этот инцидент убедительно подчеркивает фундаментальный принцип безопасности: прочность системы определяется ее самым слабым звеном, а не самым сильным. Сокрытие проприетарных рассуждений или пользовательских данных от пользователя, даже за надежным шифрованием, не обеспечивает подлинной конфиденциальности или безопасности, если менее защищенная «родственная» модель может быть принуждена третьими лицами к раскрытию этих якобы защищенных мыслей.

В конечном итоге урок ясен для всех архитекторов безопасных систем. Механизмы безопасности должны защищать конфиденциальные данные от всех несанкционированных точек доступа, а не только от самых очевидных или мощных. Когда архитектура позволяет расшифровывать конфиденциальную информацию через уязвимый компонент, вся система оказывается скомпрометированной, независимо от предполагаемой надежности ее основных средств защиты.

Часто задаваемые вопросы

В чем заключалась уязвимость рассуждений ИИ?

Это изъян, при котором зашифрованные «цепочки рассуждений» (chain-of-thought) мощных моделей ИИ могли быть украдены путем их повторной отправки в более слабую и менее защищенную модель того же провайдера, которая затем расшифровывала и раскрывала секретные мысли.

Что такое 'cross-model replay attack'?

Это метод, при котором исследователи берут зашифрованный вывод дорогой и защищенной модели ИИ и передают его более дешевой «родственной» модели. Более слабую модель можно взломать (jailbreak), заставив ее расшифровать и раскрыть рассуждения исходной модели.

Какие данные были раскрыты в результате этой атаки?

Атака раскрыла проприетарные рассуждения моделей, персонально идентифицируемую информацию (PII) и конфиденциальные учетные данные, такие как API keys и пароли, которые присутствовали только в скрытых, зашифрованных трассах рассуждений.

Исправили ли ИИ-компании эту уязвимость?

Да, согласно исследовательской работе, крупные провайдеры, такие как Anthropic, OpenAI и Google, признали проблему после ответственного раскрытия и внедрили меры по смягчению последствий. Сообщается, что исходные атаки больше не эффективны.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only