Skip to content
research

OpenAI의 AI, 이제 비밀리에 사고한다

OpenAI의 다음 도약은 단순히 AI를 더 똑똑하게 만드는 것이 아니라, 우리가 이해할 수 없는 사적인 언어로 생각하게 만드는 것입니다. 이러한 효율성 돌파구는 AI 안전에 있어 가장 큰 위협이 될 수 있습니다.

Aki Tanaka
OpenAI의 AI, 이제 비밀리에 사고한다

언어를 넘어: AI의 새로운 'Neuralese'

OpenAI의 미공개 Astra 모델은 '루프형 트랜스포머(looped transformer)'라고도 불리는 순환 깊이(recurrent depth)라는 획기적인 기술을 특징으로 합니다. The Information에 의해 처음 상세히 다뤄진 이 아키텍처 혁신은 AI가 단 한 단어를 생성하기 전에도 광범위한 내부 연산을 수행할 수 있게 하며, 이는 이전 GPT 모델들과의 중요한 차별점입니다.

기존의 거대 언어 모델은 "신경망 단어, 신경망 단어"와 같이 정보를 순차적으로 처리합니다. 이들은 매 단계마다 토큰을 출력하므로 그들의 "사고 과정(chain of thought)"이 어느 정도 투명하게 드러납니다. 반면 Astra는 동일한 레이어를 루프 형태로 여러 번 반복하여 연산을 수행합니다. 이는 수십억 개의 새로운 파라미터를 추가하지 않고도 기존 레이어를 재사용하여 더 깊고 복잡한 연산을 가능하게 함으로써 더 높은 지능을 달성합니다.

이러한 내부적이고 반복적인 처리를 통해 AI는 연구자들이 Neuralese라고 부르는 풍부한 내부 숫자 상태로 직접 추론할 수 있습니다. Astra는 생각을 영어 단어와 같은 사람이 읽을 수 있는 토큰으로 변환하는 대신, 수천 개의 숫자를 기반으로 작동합니다. 이 내부 표현은 언어적 사고보다 수천 배 더 데이터 밀도가 높으며, 외부 관찰자에게는 완전히 불투명한 상태로 초고효율의 고도로 통합된 추론을 가능하게 합니다.

더 많은 두뇌, 같은 크기

순환 깊이, 즉 루프형 트랜스포머는 "클수록 좋다"는 오랫동안 유지되어 온 AI 패러다임을 깨뜨립니다. 이 돌파구는 더 작은 모델이 훨씬 더 크고 자원 집약적인 아키텍처에서만 볼 수 있었던 강력한 성능을 달성할 수 있게 합니다. 이는 엄청난 효율성 향상을 가져오며, 고급 기능을 구현하기 위해 더 이상 수십억 개의 새로운 파라미터가 필요하지 않음을 의미합니다.

각 레이어마다 더 넓은 신경망 경로를 구축하는 대신, 이 기술은 기존 레이어를 재사용하여 정보를 반복적으로 순환시킵니다. 이러한 아키텍처 변화는 모델의 물리적 크기를 확장하지 않고도 연산 깊이를 더합니다. 그 결과 메모리 및 하드웨어 비용이 크게 절감되어 고성능 AI를 더 접근하기 쉽고 확장 가능하게 만듭니다.

보고서에 따르면 이 방식을 활용한 OpenAI의 Astra 모델은 이전 모델보다 최대 14배 적은 출력 토큰으로 더 우수한 결과를 달성합니다. 이러한 놀라운 성능 향상은 AI가 최소한의 외부 텍스트를 생성하면서 광범위한 내부 추론을 수행할 수 있게 함으로써 기능의 근본적인 변화를 의미합니다.

안전 전문가의 악몽

순환 깊이는 AI 안전에 심각한 도전 과제인 모니터링 문제를 야기합니다. 이 기술은 Astra와 같은 모델이 인간의 언어보다 훨씬 풍부한 수천 개의 숫자로 구성된 Neuralese를 사용하여 내부적으로 정보를 처리할 수 있게 합니다. AI의 의사결정 과정은 불투명한 블랙박스가 되어, 그 진정한 추론 과정이 인간의 감독으로부터 숨겨지게 됩니다.

사고 과정(chain-of-thought, CoT) 추론을 사용하는 기존의 거대 언어 모델과 비교해 보십시오. 이 모델들은 중간 텍스트를 생성하여 "작업 과정을 보여주며", 이는 OpenAI 스스로가 한때 옹호했던 투명성 기능입니다. 이러한 읽기 쉬운 토큰 기반 출력은 연구자들이 AI의 사고 과정을 면밀히 조사하여 잠재적인 정렬 오류나 위험한 의도를 식별할 수 있게 합니다. 예를 들어, "이걸 하면 안 된다는 걸 알지만 어쨌든 하겠다"와 같은 CoT는 즉시 감지할 수 있습니다.

이제 그 결정적인 가시성이 사라집니다. AI 안전 연구원들은 이것이 "AI 안전 분야에서 지금까지 발생한 최악의 사태"가 될 수 있다고 경고합니다. AI Futures Project의 연구원인 Thomas Larsen은 AI가 여전히 정렬되지 않을 가능성이 있음에도 불구하고 "우리는 AI가 무엇을 하고 있는지 파악할 능력을 잃게 될 것"이라며 우려를 표했습니다. 이러한 통찰력의 상실은 위험한 AI 행동을 감지하고 예방하는 가장 신뢰할 수 있는 방법을 제거하며, AI가 우리가 해석할 수 없는 언어로 작동하더라도 그 내부 상태에 대한 AI의 자체 보고를 신뢰할 수밖에 없게 만듭니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

OpenAI의 계산된 위험

OpenAI 경영진은 recurrent depth에 내재된 심각한 모니터링 문제를 인정합니다. 이를 완화하기 위해 그들은 Astra 내에서 해당 기술의 적용을 제한하고 있으며, 의도적으로 읽기 쉬운 Chain of Thought(CoT)를 보존하고 있습니다. 이를 통해 연구원들은 AI의 추론 과정을 충분히 모니터링할 수 있으며, 중요한 안전 장치를 유지할 수 있습니다. 강력한 AI 시스템을 계속해서 파악 가능하고 안전하게 유지하는 것은 그들의 연구 프로그램이 명시한 핵심 목표이며, 이는 배포 전략의 지침이 됩니다.

이러한 계산된 신중함은 Astra의 놀라운 능력과 극명한 대조를 이룹니다. OpenAI는 Astra를 자사의 Preparedness Framework 하에서 "Critical" 사이버 보안 능력 임계값에 도달한 첫 번째 모델로 지정했습니다. 이는 Astra가 이전에 알려지지 않은 보안 결함인 제로데이 취약점을 자율적으로 발견하고 이를 악용할 수 있는 기능적 방법을 개발할 수 있음을 의미합니다. 이러한 전례 없는 자율적 공격 생성 기능과 불투명한 Neuralese 추론을 결합하면, 인간이 내부 사고 과정을 이해하지 못한 채 작동하는, 심각한 사이버 공격 능력을 갖춘 블랙박스 AI라는 무시무시한 시나리오가 만들어집니다.

이 중대한 발전은 OpenAI와 더 넓은 AI 커뮤니티에 결정적인 질문을 던집니다. 이것이 내재된 불투명성과 복잡한 안전 트레이드오프에도 불구하고 강력한 새로운 아키텍처를 수용하며 AGI를 향해 나아가는, 비록 위험 부담은 크지만 필수적인 선구적 단계일까요? 아니면 이것이 AI의 원초적인 힘과 효율성을 끈질기게 추구하는 과정에서 안전, 투명성, 인간의 감독이라는 근본적인 필수 요건을 압도하는, 무모한 "모니터링 불가능을 향한 질주"의 시작일까요? 그 대답이 다가올 AI 개발 시대를 정의할 것입니다.

자주 묻는 질문

OpenAI의 Astra 모델이란 무엇인가요?

Astra는 OpenAI에서 출시하지 않은 차세대 AI 모델로, 'recurrent depth'라는 새로운 기술을 사용하여 효율성과 성능을 크게 향상시킨 것으로 알려져 있습니다.

'recurrent depth' 또는 'looped transformer'란 무엇인가요?

이는 AI가 출력을 생성하기 전에 동일한 신경망 계층을 통해 정보를 내부적으로 여러 번 반복할 수 있게 하는 아키텍처 기술입니다. 이는 모델 크기를 늘리지 않고도 계산을 심화시킵니다.

'Neuralese'란 무엇인가요?

'Neuralese'는 모든 단계를 영어와 같이 인간이 읽을 수 있는 언어로 번역하는 대신, AI가 내부 숫자 표현(수천 개의 숫자로 이루어진 벡터)으로 직접 추론하는 능력을 일컫는 용어입니다.

연구원들이 Astra의 새로운 기술에 대해 우려하는 이유는 무엇인가요?

가장 큰 우려는 이 기술이 AI의 추론 과정을 '블랙박스'로 만든다는 점입니다. 'Neuralese'로 사고하게 되면 모델의 사고 과정(chain of thought)이 숨겨지게 되어, 인간이 위험하거나 정렬되지 않은 행동을 모니터링하기가 극도로 어려워집니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.