GPT-7のことは忘れよう:OpenAIが実際に公開したもの
OpenAIは「GPT-7」のような新しい名称のモデルを発表したわけではない。その代わり、同社は未発表の内部モデルによって生成された722本の数学論文を公開した。これらは372の関連する結果のファミリーに分類されており、約4,000件の未解決の研究課題に直接取り組んでいる。
広まっている「GPT-7」という憶測は、公式な確認ではなく、ネット上で拡散された推測に基づいている。OpenAIは一貫してこのシステムを「未発表の内部モデル」と呼んでおり、商用製品や既存のGPTシリーズの後継機としてではなく、社内での運用状況を強調している。
この取り組みの規模が重要なのは、標準的なベンチマークを超越しているからだ。公開されたものには、単なる主張や印象的なチャットボットの回答だけでなく、Lean定理証明支援系で検証された形式的な証明などの裏付けとなる成果物も含まれている。これにより、外部の研究者が数学的な主張を独自に検証することが可能となり、検証可能な機械支援型の発見へと向かう大きな転換点となっている。
このコレクションは、以下を含む幅広い数学分野をカバーしている:
- 数論
- 幾何学
- 確率論
- 理論計算機科学
- 数理物理学
結果あたりの平均計算コストは、ChatGPT Proの思考時間で約3時間であり、主に単一のプロンプトによるものである。これは、大規模なエージェント群を必要とした従来のリソース集約的なアプローチとは対照的である。
これらは宿題ではなく、研究課題である
正解がわかっている典型的な宿題とは異なり、OpenAIのモデルは未解決問題に取り組んだ。これは専門家の間でも答えが確立されていない問いである。モデルは約4,000件のそのような問題に取り組み、多様な数学分野を網羅している。
これらの研究課題は以下に及ぶ:
- 数論
- 幾何学
- 確率論
- 計算機科学
- 数理物理学
OpenAIは、372の成果ファミリーのリストは重要度の順位付けではなく、同社の内部モデルによる探求の広さを反映したものだと述べている。
報告された成果は大きく異なる。722本の論文の中には完全な解決を主張するものもあれば、複雑な問題に対する部分的な進展を詳述するものもある。重要なのは、一部の論文が反例を提示し、長年信じられてきた予想を否定することで、数学的な境界線に対する繊細な理解を示している点である。
特に注目すべき主張の一つであるFamily 003は、準リーマン予想に関するものである。これはリーマンゼータ関数について、特に $\text{Re}(s) > 7/8$ において $\zeta(s) \neq 0$ となる零点のない領域を確立するものである。これが完全なリーマン予想の証明ではなく、より弱い主張であることに注意が必要である(リーマン予想自体は未解決のままである)。研究者たちは、Lean定理証明支援系を使用して、この特定の成果を独自に再現・検証している。
証明は自信に満ちた回答よりも強力である
数学的証明には、単に多数の例でパターンが成立することを示すのではなく、あらゆる可能なケースを網羅する妥当な論証が求められる。数千の事例でルールをテストしても、それは傾向を示すだけであり、そのルールの普遍的な真実性を証明するものではない。たった一つの反例が予想全体を無効にする可能性があり、数学には厳密さが不可欠であることを物語っている。
OpenAIは、対話型定理証明器であるLeanを活用し、多くの証明ステップを形式化しました。Leanは、提示されたルールや前提条件に基づいてこれらのステップを検証できるため、説得力のある文章をはるかに超えた確実性を提供します。このコンピュータで検証された成果物は、自動化されたカーネルが議論の論理的一貫性を検証するため、より強力な証拠となります。
すべての結果がコンピュータで検証可能な証明を誇るわけではなく、検証済みの研究であっても、それが原稿内の主張を真に証明していることを確認するには精査が必要です。数学と人工知能に関する諮問グループ(AGMAI)がオープンサイエンスの基準について助言を行いましたが、その関与はすべての結果の検証を意味するものではありません。この取り組みの詳細については、Sharing AI Progress in Mathematics - OpenAI を参照してください。
例えば、注目すべき主張の一つであるquasi-Riemann hypothesis(ファミリー003)は、リーマンゼータ関数の零点のない領域を仮定しています。有名な仮説のこの弱いバージョンは、研究者たちがLeanコンパイラを使用して独自に再現・検証しており、数学的理解を深める上での形式検証の威力を浮き彫りにしています。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
真の転換点は、AI研究がどのようにテストされるかにある
OpenAIは、各成功した結果について、未リリースのモデルによるChatGPT Pro thinking timeが平均して約3時間かかったと報告しました。この数値は、その特定の内部システムが結果を生成するために必要な計算量を定量化したものであり、コンシューマー向けのChatGPT Proサブスクリプションで3時間実行すれば未解決の研究問題を解けることを保証するものではありません。また、この数値には、人間や自動化による広範な検証ステップは含まれていません。
これをOpenAIの以前のNavier–Stokesプロジェクトと比較すると、同プロジェクトでは約10,000のAIエージェントが88時間稼働しました。これら二つの数値は、異なる問題や手法における計算負荷の異なる側面を測定したものであり、直接的な高速化や一般的なモデル能力の突然の飛躍を証明するものではありません。タスクが異なれば、必要な計算戦略も異なります。
数学とコードは、証明をアルゴリズム的に(多くの場合Leanのようなツールを使用して)チェックできるため、AIの推論にとって非常に検証しやすいテスト環境を提供します。これにより、AIが生成したソリューションを評価する際に、かつてない厳密さが可能になります。しかし、これらの構造化された領域での成功が、倫理、社会科学、創作活動といった形式的でない分野全体における汎用人工知能や信頼性の高いパフォーマンスを自動的に証明するわけではありません。
科学コミュニティにとっての生産的な問いは、独立した数学者がこれらの結果を再現し、文脈化し、改善できるかどうかという点にあります。検証可能なオープンサイエンスへのこの重点的な取り組みは、ニュースサイクルを支配しがちな憶測に基づく「GPT-7」の見出しとは対照的であり、誇大広告から具体的で検証可能な進歩へと焦点を移しています。
よくある質問
OpenAIはGPT-7というモデルを発表しましたか?
いいえ。今回のリリースは未リリースの内部モデルについて説明したものであり、GPT-7は憶測に過ぎず、正式名称ではありません。
そのモデルは何を生み出しましたか?
OpenAIは、約4,000の研究問題に基づく、372の結果ファミリーに分類された722の数学的原稿を共有しました。
そのモデルはリーマン予想を解きましたか?
いいえ。ある原稿がより弱いquasi-Riemannの結果を主張していますが、リーマン予想全体は未解決のままです。
すべての数学的結果は検証済みですか?
いいえ。コンピュータで検証可能なLeanの成果物を持つ証明もあれば、専門家によるレビューが必要で、誤りが含まれている可能性のあるものもあります。

