Skip to content
industry insights

DeepSeekの頭脳が崩壊した

DeepSeekの最新モデルはベンチマークを塗り替え、GPT-5.6のような巨人に挑戦しています。しかし、単純な3Dパズルが、AIにとっての「視覚的理解」とは何かを問い直す重大な欠陥を明らかにしました。

Cassidy Wolfe
DeepSeekの頭脳が崩壊した

立方体さえ見えないベンチマーク・スレイヤー

DeepSeek V4.1 flashは2026年9月10日に突如登場しました。552Bのバックボーンと驚異的な1Mトークンのコンテキストウィンドウを誇る、マルチモーダルなMixture-of-Experts (MoE)モデルです。入力に8B、出力に16Bのアクティブパラメータを持ち、MITライセンスで提供されるこの挑戦者は、キャッシュされた入力トークン100万あたり0.003ドルという競争力のある価格設定で、単なる新参者ではありませんでした。OpenAIのGPT-5.6 SolやAnthropicのClaude Opus-5.0を重要なエージェント型ベンチマークで上回ったとされ、エージェントによるコーディング、推論、視覚的理解を再定義しようとしています。

そこに、シミュレートされたRubik's cubeとCodexのハーネスを携えたMatthew Bermanが登場しました。彼のバイラルテストは、DeepSeek V4.1 flashが謳う視覚的・空間的推論を検証することを目的としていました。課題は単純で、キューブを解くこと。これは「ネイティブな画像理解」と優れた知能を主張するモデルにとって、重大な意味を持つものでした。

展開されたのは高度なAIのデモンストレーションではなく、壮大なメルトダウンでした。DeepSeek V4.1 flashはRubik's cubeを解けなかっただけでなく、その本質さえ理解できていませんでした。Bermanのビデオでは、各正方形が全体から切り離されて独立して浮遊し、物理的な動きがないにもかかわらず色が不可解に変化する様子が映し出されていました。モデルは、この「不正」とも言える変化する現実を前にしても完全に困惑しており、固体やその固有の空間的関係を認識できていませんでした。

「視覚的理解」だけでは不十分な理由

「ネイティブな画像理解」と1Mトークンのコンテキストで宣伝されていたDeepSeek V4.1 flashは、単純なRubik's cubeで壮大に失敗しました。Matthew Bermanのビデオ「DeepSeek Fails the Rubik’s Cube Test」は、モデルが動的な3Dオブジェクトを把握できないという重大な断絶を容赦なく暴きました。これは単なるバグではなく、誇張された視覚能力における根本的な欠陥です。

Codexのハーネス上で実行されたV4.1 flashモデルは、キューブを完全に誤って表現しました。正方形は接続されずに「独立して浮遊」し、物理的な回転なしに側面の色が変化しました。システムは色を直接変更するという「不正」を行ったにもかかわらず、パズルを解くことには失敗しました。これは、一貫性のある持続的な空間モデルを維持する能力が著しく欠如していることを示しています。

「これはキューブである」といった静的なオブジェクトを認識することと、動的な環境でその物理法則を操作することは全く別の話であり、異なる認知アーキテクチャを必要とします。これには、関係性、重力、動きに関する持続的な内部表現が必要です。DeepSeek V4.1 flashのパフォーマンスは、この重要な3D推論が欠如しており、複雑な相互作用を断片的な視覚イベントに還元してしまっていることを示唆しています。

これはDeepSeekにとっての例外ではありません。以前のバージョンでも、他のテストで複雑な空間レンダリングや正確な軸移動に苦戦していました。Rubik's cubeでの失敗は、繰り返されるアキレス腱を浮き彫りにしており、DeepSeekの印象的なベンチマークスコアが、物理空間の基礎的な理解におけるより深く未解決の問題を隠蔽している可能性があることを示唆しています。

Rubik's cube:AIの真実を暴く試金石

Rubik's cubeは長い間、AIにとっての究極の試金石であり、深い知能を要求する一見単純な課題として機能してきました。例えば、Google DeepMindのDeepCubeAは、2019年に平均20手でキューブを解いたことで有名であり、専門化されたAIがこのタスクを習得できることを証明しました。これはAIにとって新しい問題ではなく、すでに解決済みの問題なのです。

単なるパズル解きを超えて、このキューブはモデルの以下の能力を厳密に測定します:

  • 空間推論: 3Dオブジェクトの操作を理解する能力。
  • 状態維持: 絶えず変化するキューブの構成を追跡する能力。
  • 論理的計画: 多段階の解決策を戦略的に立てる能力。

これは単なるピクセルやパターンの認識ではなく、オブジェクトの物理的ルールを内面化することを必要とします。

100万トークンのコンテキストを誇り、エージェントベンチマークにおいてOpenAIのGPT-5.6 SolやAnthropicのClaude Opus-5.0に対して競争力のある勝利を収めたDeepSeek V4.1 flashが、この基本的な検証で崩壊しました。四角形が独立して浮遊し、動きなしに色が変化するという観察された失敗は、その「ネイティブな画像理解」における深刻な乖離を露呈しています。ルービックキューブは容赦のない「真実の血清」として機能し、ベンチマーク上の虚勢を剥ぎ取り、モデルが物理世界を真に把握しているかを明らかにします。彼らの高度なモデルの詳細については、DeepSeek | Into the Unknownをご覧ください。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

ベンチマークを超えて:物理的グラウンディングの探求

DeepSWE v1.1やCyberGymのような高度なエージェントベンチマークであっても、重要な死角を見逃すことがよくあります。DeepSeek V4.1 flashはこれらにおいてGPT-5.6 SolやClaude Opus-5.0を上回ると報告されていますが、シミュレーションされたルービックキューブには失敗しており、抽象的なタスクのパフォーマンスと基本的な物理的現実との間の深刻な乖離を実証しています。モデル内の四角形は独立して浮遊し、動きなしに色が変化しました。これは単なる解決の失敗ではなく、物理法則の明白なハルシネーション(幻覚)です。

これは物理的グラウンディングの巨大な課題を浮き彫りにしています。モデルは膨大な抽象的知識と「ネイティブな画像理解」を持っているかもしれませんが、3D空間における因果関係の一貫した内部モデルがなければ、その知性は脆いままです。DeepSeek V4.1 flashは、100万トークンのコンテキストとマルチモーダル機能を備えているにもかかわらず、視覚入力を単純なオブジェクトの具体的で永続的なルールに結びつけることができませんでした。

AIがテキストや静止画像を超えて、ロボティクス、複雑なシミュレーション、現実世界のエージェントタスクへと真に進歩するためには、このギャップを埋める必要があります。モデルには、ピクセルの表面的な解釈だけでなく、私たちが住む物理世界に対する堅牢で永続的な理解が必要です。それが達成されるまで、ベンチマークを圧倒するモデルであっても、宇宙の最も単純な真実に直面したときには崩壊し続けるでしょう。

よくある質問

動画でテストされたモデルは何ですか?

この動画では、OpenAIのCodexハーネスを使用して、2026年9月にリリースされた強力なマルチモーダルMixture-of-Experts (MoE) モデルであるDeepSeek V4.1 Flashをテストしています。

なぜDeepSeekモデルはルービックキューブのテストに失敗したのですか?

モデルがルービックキューブの一貫した3Dモデルを維持できなかったためです。四角形が独立して浮遊し、動きなしに色が変化したことは、空間的および物理的な理解が根本的に欠如していることを示しています。

AIがルービックキューブを解いたことはありますか?

はい。2019年、カリフォルニア大学アーバイン校のDeepCubeAという深層強化学習AIが、一瞬で解くことができました。これは、特化型AIと大規模マルチモーダルモデルの汎用的な推論能力との間のギャップを浮き彫りにしています。

この失敗は現在のAIベンチマークについて何を明らかにしていますか?

標準的なエージェントおよび推論ベンチマークが、物理的グラウンディングや動的な空間理解を十分にテストできていない可能性を示唆しており、高スコアのモデルであっても重要な死角を抱えている可能性があることを示しています。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

ビルダーの方へ

このページは、他社のツールのために働いています。

AIエージェントが読み、購入検討層がたどり着きます。8言語とMCP経由で答えます。あなたのツールにも同じページを — 24時間以内に公開。