포트 녹스가 아니었던 것
AI의 내부 chain-of-thought(CoT)는 주요 연구소들이 철저히 보호하는 독점적인 "비밀 소스"를 나타냅니다. 고급 기능을 추출하고 경쟁 우위를 유지하는 데 필수적인 이 단계별 추론은 핵심 지적 재산권을 구성합니다. 연구소들은 API 응답을 설계하여 직접적인 접근을 차단함으로써 이러한 귀중한 사고 과정을 경쟁자들로부터 보호했습니다.
이 CoT를 보호하기 위해 API는 불투명하고 암호화된 추론 "블롭(blob)"을 반환했습니다. 이 읽을 수 없는 덩어리는 블랙박스 역할을 했습니다. 사용자는 후속 대화에서 문맥을 위해 이를 모델에 다시 전달할 수 있었고, 내부의 복잡한 사고 과정을 드러내지 않으면서 지속적인 대화를 가능하게 했습니다. 이 메커니즘은 원래의 모델 제공자만이 이 암호화된 데이터를 해석하고 안전하게 재사용할 수 있도록 하여 경쟁자들이 모델을 리버스 엔지니어링하지 못하도록 하는 것을 목표로 했습니다.
그러나 이 강력하다고 여겨졌던 보안 시스템은 근본적인 설계 결함을 안고 있었고, 포트 녹스를 체로 만들어 버렸습니다. 암호화된 추론 블롭은 보편적이었으며, 특정 사용자, 개별 세션, 심지어 그것을 생성한 강력한 모델과도 고유하게 연결되어 있지 않았습니다. 이러한 아키텍처적 간과로 인해 전체 모델 제품군에 걸쳐 공유되는 복호화 키라는 단일하고 치명적인 취약점이 발생했습니다. 이로 인해 값비싸고 보호받는 모델의 private thoughts가 더 저렴하고 덜 보호받는 형제 모델들에 의해 보편적으로 복호화될 수 있게 되었고, 의도된 보호 기능을 완전히 우회하게 되었습니다.
작은 형제의 키로 금고 열기
연구원들은 AI 모델의 내부 추론을 보호하는 독점 암호화를 우회하기 위해 cross-model replay attack을 고안했습니다. 그들은 Claude Opus나 GPT-4와 같은 강력한 모델에 프롬프트를 입력하는 것으로 시작했으며, 이 모델들은 복잡한 chain-of-thought를 불투명하고 암호화된 블롭으로 반환했습니다. 이 "덩어리"는 읽을 수 없도록 설계되었지만, 모델이 대화 전반에 걸쳐 문맥을 유지하는 데 필수적이었습니다.
독창적인 단계는 이 동일한 암호화된 블롭을 수정 없이 동일한 제공자 제품군의 더 작고 덜 보호받는 "형제" 모델에 입력하는 것이었습니다. 예를 들어, Claude Opus 4.8의 암호화된 추적은 Claude Haiku에 직접 재생될 수 있었습니다. 이러한 아키텍처적 취약점은 블롭이 보편적으로 수용된다는 것을 의미하며, 모델 제품군 전체에 걸쳐 공유되는 암호화 키가 있음을 암시했습니다.
중요한 점은 Haiku와 같은 이러한 더 작은 모델들은 간단하고 허용적인 프롬프트로 jailbreak하기가 훨씬 쉽다는 것입니다. 연구원들은 이러한 약화된 보안 상태를 악용하여 더 약한 형제 모델이 강력한 모델의 비공개 생각을 복호화하고 일반 텍스트로 드러내도록 속였습니다. 이는 사실상 "남동생"을 의도치 않은 디코더로 만들어 원래의 암호화를 쓸모없게 만들고 독점적인 추론 과정을 노출시켰습니다.
그림자 속에 숨겨져 있던 것
연구원들은 단순히 AI의 내부 독백을 엿본 것이 아니라, 대규모 데이터 추출을 수행했습니다. 그들은 cross-model replay attack을 통해 공개적으로 사용 가능한 코드 저장소에서 놀라운 315,320개의 reasoning blocks를 체계적으로 해독했습니다. 이것은 단순한 유출이 아니라 이전에 숨겨져 있던 정보의 대홍수였습니다.
복구된 추적 데이터 속에는 원래 사용자들에게는 완전히 보이지 않는 매우 민감한 데이터가 묻혀 있었습니다. 분석 결과 367건의 개인 식별 정보(PII)와 62개의 API 키 및 33개의 고유 비밀번호를 포함한 182개의 노출된 자격 증명이 발견되었습니다. 이는 당연하게 여겨졌던 개인 정보 보호가 심각하게 침해되었음을 보여줍니다.
이 취약점은 다음과 같은 네 가지의 뚜렷하고 강력한 공격 벡터를 허용합니다:
- 지적 재산권 도용: 경쟁사가 AI의 독점적 사고 과정(proprietary thinking)을 추출할 수 있게 합니다.
- 대규모 개인 데이터 추출: 민감한 사용자 정보를 수집합니다.
- 필터링된 유해 콘텐츠 노출: 모델이 검열하도록 프로그래밍된 내용을 드러냅니다.
- 보이지 않는 프롬프트 인젝션: 사용자가 모르는 사이에 AI의 행동을 조작합니다.
이 발견에 대한 더 자세한 기술적 내용은 연구 논문 Stealing Reasoning Traces from Proprietary LLM APIs - arXiv을 참조하십시오.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
패치는 완료되었지만, 교훈은 남았다
크로스 모델 리플레이 공격(cross-model replay attack)에 대한 소식은 기술 커뮤니티 전반에 빠르게 퍼져나갔습니다. 315,000개 이상의 추론 블록을 노출시킨 이 새로운 복호화 탈옥(jailbreak) 기술을 상세히 다룬 연구 논문은 격렬한 토론을 불러일으켰습니다. 이 논문은 Hacker News에서 700점 가까운 점수와 수백 개의 댓글을 받으며 AI 모델 보안 및 데이터 처리에 대한 광범위한 우려를 부각시켰습니다.
연구원들의 책임 있는 공개(responsible disclosure) 이후, 주요 AI 제공업체들은 신속하게 취약점 해결에 나섰습니다. Anthropic, OpenAI, Google은 모두 결함을 인정했으며, 이 특정 공격 벡터로부터 모델을 보호하기 위한 패치를 배포했음을 확인했습니다. 이러한 신속한 조치는 발견된 기술로 인한 즉각적인 위험을 완화하는 데 도움이 됩니다.
이번 사건은 시스템의 강점은 가장 강력한 부분이 아니라 가장 약한 고리에 의해 결정된다는 기본적인 보안 원칙을 강력하게 상기시켜 줍니다. 강력한 암호화(encryption) 뒤에 숨겨져 있더라도, 덜 강력한 '형제' 모델이 제3자에 의해 강제로 보호된 생각을 드러내게 된다면, 이는 진정한 개인정보 보호나 보안을 제공하지 못합니다.
결국, 안전한 시스템을 설계하는 모든 이들에게 주는 교훈은 명확합니다. 보안 메커니즘은 가장 명백하거나 강력한 접근 지점뿐만 아니라 모든 비인가 접근 지점으로부터 민감한 데이터를 보호해야 합니다. 아키텍처상 민감한 정보가 취약한 구성 요소에 의해 복호화될 수 있다면, 주 보안 장치의 강점과 관계없이 시스템 전체가 위태로워집니다.
자주 묻는 질문(FAQ)
AI 추론 취약점이란 무엇인가요?
강력한 AI 모델의 암호화된 '사고의 연쇄(chain-of-thought)' 추론 결과가 동일한 제공업체의 더 약하고 보안이 취약한 모델에 재입력(replay)되어 복호화되고, 그 비밀스러운 생각이 노출될 수 있는 결함을 말합니다.
'크로스 모델 리플레이 공격'이란 무엇인가요?
연구원들이 고가의 보안 AI 모델에서 나온 암호화된 출력을 가져와 더 저렴한 '형제' 모델에 입력하는 기술입니다. 더 약한 모델은 탈옥(jailbreak)되어 원래 모델의 추론 과정을 복호화하고 노출하게 됩니다.
이 공격으로 어떤 종류의 데이터가 노출되었나요?
이 공격은 독점적인 모델 추론, 개인 식별 정보(PII), 그리고 숨겨진 암호화된 추론 흔적에만 존재하던 API 키 및 비밀번호와 같은 민감한 자격 증명을 노출시켰습니다.
AI 기업들이 이 취약점을 수정했나요?
네, 연구 논문에 따르면 Anthropic, OpenAI, Google과 같은 주요 제공업체들은 책임 있는 공개 이후 결함을 인정하고 완화 조치를 배포했습니다. 보고된 바에 따르면 기존의 공격 방식은 더 이상 유효하지 않습니다.

