Skip to content
research

OpenAI의 비밀 수학 모델이 GPT-7보다 더 중요한 이유

바이럴 라벨이 증거보다 앞서 나가고 있는 가운데, 수학자들은 더 중요한 질문에 직면해 있습니다. AI가 생성한 발견을 어떻게 검증해야 할까요? 그 해답은 모델 이름이 정해지기도 훨씬 전에 연구 방식을 재편할 수 있습니다.

Aki Tanaka
OpenAI의 비밀 수학 모델이 GPT-7보다 더 중요한 이유

GPT-7은 잊으세요: OpenAI가 실제로 공개한 것

OpenAI는 "GPT-7"과 같은 새로운 이름의 모델을 발표하지 않았습니다. 대신, 미공개 내부 모델이 생성한 722개의 수학 원고를 372개의 관련 결과군으로 정리하여 공개했습니다. 이 결과물은 약 4,000개의 미해결 연구 과제를 직접적으로 다루고 있습니다.

널리 퍼진 "GPT-7" 추측은 OpenAI의 공식 확인이 아닌 바이럴 추측에서 비롯된 것입니다. OpenAI는 해당 시스템을 상용 제품이나 기존 GPT 시리즈의 후속작이 아닌, 현재 회사 내부에서 운영 중인 '미공개 내부 모델'로 일관되게 지칭하고 있습니다.

이 연구의 규모가 중요한 이유는 표준 벤치마크를 넘어섰기 때문입니다. 이번 공개에는 단순한 주장이나 인상적인 챗봇 답변뿐만 아니라, Lean 정리 증명기(Lean theorem prover)로 검증된 형식적 증명과 같은 보조 자료도 포함되어 있습니다. 이를 통해 외부 연구자들이 수학적 주장을 독립적으로 검증할 수 있게 되었으며, 이는 검증 가능한 기계 보조 발견으로의 중요한 전환을 의미합니다.

이 컬렉션은 다음과 같은 광범위한 수학 분야를 다룹니다:

  • 정수론
  • 기하학
  • 확률론
  • 이론 컴퓨터 과학
  • 수리 물리학

결과당 평균 컴퓨팅 비용은 ChatGPT Pro 사고 시간으로 약 3시간이었으며, 주로 단일 프롬프트를 통해 이루어졌습니다. 이는 대규모 에이전트 군집을 활용하던 기존의 자원 집약적 방식과는 대조적입니다.

이것은 숙제가 아닌 연구 질문이었습니다

정답이 정해져 있는 일반적인 숙제 문제와 달리, OpenAI의 모델은 전문가들 사이에서도 답이 알려지지 않은 미해결 문제(open problems)를 다루었습니다. 모델은 다양한 수학 분야에 걸쳐 약 4,000개의 이러한 문제를 다루었습니다.

이 연구 질문들은 다음 분야를 포괄했습니다:

  • 수론
  • 기하학
  • 확률론
  • 컴퓨터 과학
  • 수리 물리학

OpenAI는 372개의 결과군 목록이 중요도 순위가 아니며, 내부 모델이 탐구한 범위의 폭을 반영한다고 밝혔습니다.

보고된 결과는 상당히 다양합니다. 722개의 원고 중 일부는 완전한 해결책을 주장하는 반면, 다른 일부는 복잡한 문제에 대한 부분적인 진전을 상세히 설명합니다. 결정적으로, 일부 논문은 오랫동안 유지되어 온 추측을 반증하는 반례(counterexamples)를 제시하며 수학적 경계에 대한 미묘한 이해를 보여줍니다.

특히 주목할 만한 주장인 Family 003은 준 리만 가설(quasi-Riemann hypothesis)과 관련이 있습니다. 이는 리만 제타 함수에 대해 $\text{Re}(s) > 7/8$일 때 $\zeta(s) \neq 0$이라는 영점이 없는 영역을 설정합니다. 이는 완전한 리만 가설의 증명이 아니라 더 약한 주장임을 이해하는 것이 중요하며, 리만 가설 자체는 여전히 미해결 상태입니다. 연구자들은 Lean 정리 증명기를 사용하여 이 특정 결과를 독립적으로 재현하고 검증했습니다.

증명은 확신에 찬 답변보다 강력합니다

수학적 증명은 단순히 수많은 사례에서 패턴이 유지되는 것이 아니라, 가능한 모든 경우를 포괄하는 타당한 논증을 요구합니다. 수천 개의 사례에서 규칙을 테스트하는 것은 경향성을 보여줄 뿐, 그 규칙의 보편적 진리를 증명하지는 못합니다. 단 하나의 반례만으로도 전체 추측이 무효화될 수 있으며, 이는 수학적 엄밀함이 얼마나 중요한지를 잘 보여줍니다.

OpenAI는 대화형 정리 증명기인 Lean을 활용하여 많은 증명 단계를 공식화했습니다. Lean은 명시된 규칙과 가정에 따라 이러한 단계를 검사할 수 있으며, 설득력 있는 산문을 넘어선 수준의 확실성을 제공합니다. 이 컴퓨터 검증 아티팩트는 자동화된 커널이 논증의 논리적 일관성을 검증하므로 더 강력한 증거를 제공합니다.

모든 결과가 컴퓨터로 검증 가능한 증명을 자랑하는 것은 아니며, 검증된 작업조차도 원고의 주장을 실제로 증명하는지 확인하기 위해 면밀한 조사가 필요합니다. 수학 및 인공지능 자문 그룹(AGMAI)이 오픈 사이언스 표준에 대해 자문을 제공했지만, 그 참여가 모든 결과를 검증했다는 것을 의미하지는 않습니다. 이 이니셔티브에 대한 자세한 내용은 Sharing AI Progress in Mathematics - OpenAI를 참조하십시오.

예를 들어, 주목할 만한 주장 중 하나인 quasi-Riemann hypothesis(Family 003)는 Riemann zeta function에 대한 영점 없는 영역을 가정합니다. 유명한 가설의 이 약한 버전은 Lean 컴파일러를 사용하는 연구원들에 의해 독립적으로 재현 및 검증되었으며, 이는 수학적 이해를 발전시키는 데 있어 형식적 검증의 힘을 강조합니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

진정한 변화는 AI 연구가 테스트되는 방식에 있습니다

OpenAI는 각 성공적인 결과가 미출시 모델의 ChatGPT Pro thinking time으로 평균 약 3시간이 소요되었다고 보고했습니다. 이 수치는 특정 내부 시스템이 결과를 생성하는 데 필요한 계산 노력을 수치화한 것이며, 소비자용 ChatGPT Pro 구독이 3시간 동안 실행되어 미해결 연구 문제를 해결할 수 있다는 보장은 아닙니다. 또한 이 수치에는 광범위한 인간 및 자동화된 검증 단계는 포함되지 않습니다.

이를 OpenAI의 초기 Navier–Stokes 프로젝트와 비교해 보십시오. 이 프로젝트에는 약 10,000개의 AI 에이전트가 88시간 동안 작업했습니다. 이 두 수치는 서로 다른 문제와 방법론에 걸친 계산 부하의 서로 다른 측면을 측정하는 것이며, 직접적인 속도 향상이나 일반 모델 기능의 갑작스러운 도약을 의미하지는 않습니다. 작업마다 필요한 계산 전략이 다릅니다.

수학과 코드는 Lean과 같은 도구를 사용하여 알고리즘 방식으로 증명을 확인할 수 있기 때문에 AI 추론을 위한 매우 검증 가능한 테스트 환경을 제공합니다. 이를 통해 AI가 생성한 솔루션을 평가하는 데 있어 전례 없는 엄격함을 기할 수 있습니다. 그러나 이러한 구조화된 영역에서의 성공이 윤리, 사회 과학 또는 창의적 글쓰기와 같은 덜 형식적인 분야 전반에 걸쳐 일반 지능이나 신뢰할 수 있는 성능을 자동으로 입증하는 것은 아닙니다.

과학계에 있어 생산적인 질문은 독립적인 수학자들이 이러한 결과를 재현하고, 맥락화하며, 개선할 수 있는지 여부입니다. 검증 가능한 오픈 사이언스에 대한 이러한 강조는 뉴스 주기를 지배하는 투기적인 "GPT-7" 헤드라인과 극명한 대조를 이루며, 초점에서 유형의 테스트 가능한 진보로 관심을 옮깁니다.

자주 묻는 질문

OpenAI가 GPT-7이라는 모델을 발표했나요?

아니요. 이번 릴리스는 미출시 내부 모델을 설명하는 것이며, GPT-7은 공식 명칭이 아닌 추측입니다.

모델이 무엇을 생성했나요?

OpenAI는 약 4,000개의 연구 문제에 걸친 작업을 바탕으로 372개의 결과군으로 그룹화된 722개의 수학 원고를 공유했습니다.

모델이 Riemann hypothesis를 해결했나요?

아니요. 원고는 더 약한 quasi-Riemann 결과를 주장하고 있으며, 전체 Riemann hypothesis는 여전히 해결되지 않았습니다.

모든 수학적 결과가 검증되었나요?

아니요. 일부 증명은 컴퓨터로 검증 가능한 Lean 아티팩트를 가지고 있지만, 다른 증명은 여전히 전문가의 검토가 필요하며 오류가 포함되어 있을 수 있습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.