Skip to content
comparisons

Claudeが敗北した理由。

最高スコアを誇るClaude Opusと、より安価なオープンウェイトモデルであるQwen 3.8を、実際のコーディングバトルで対決させました。勝利したのは、ベンチマークが予測したモデルではありませんでした。

Vera Cole
Claudeが敗北した理由。

ベンチマークは嘘をつく。テストがそれを証明した。

ベンチマークは、現実世界での有用性を誤って伝えていることがよくあります。理論上、Claude Opus 5は優れているように見え、Artificial Analysisで63点を獲得しています。競合するQwen 3.8は58点で、これに続きます。この5ポイントの差は、純粋な知能と能力においてClaudeが明確な勝者であることを示唆しているはずでした。

この前提に疑問を投げかけるため、私たちは厳格なテストを考案しました。両モデルに、完全にプレイ可能な3Dエンドレスランナーゲームを作成するよう指示したのです。パラメータは厳格で、Temple Runに触発された3Dゲームを、three.jsを使用して単一のHTMLファイルに収めること。また、一切の追跡指示や修正なしで、同一のプロンプトから生成することとしました。

結果は歴然としていました。ベンチマークスコアが低いにもかかわらず、「より弱い」はずのQwen 3.8の方が、明らかにスムーズでプレイしやすいゲームを作成しました。Qwenは、移動、衝突判定、手続き型パス生成といった重要な領域で優れており、全体的により構造化されたコードベースを提供しました。

Claude Opus 5はコードを素早く生成したものの、洗練さに欠け、操作が難しいゲームとなりました。この現実世界での応用は、重大なギャップを浮き彫りにしました。ベンチマークスコアは純粋な知能を示す指標にはなりますが、複雑で創造的なタスクにおける実用性やユーザー体験を予測するには、しばしば失敗するのです。

なぜ急いでコーディングすると失敗するのか

Claude Opus 5は、3Dエンドレスランナー用の膨大なJavaScriptを即座に生成し始めました。この急速な出力は、three.jsのシーンやプレイヤーモデルが素早く形作られるという、進捗が早いかのような錯覚を生み出しました。コードが流れ込んでくる様子を見ていると、Claudeが最初のレースに勝っているように感じられました。

Qwen 3.8は、全く異なる、体系的な戦略を採用しました。まず、ゲームループ、プレイヤーの状態、衝突判定、手続き型生成といったゲームのコアシステムを綿密に概説することから始めました。この包括的なアーキテクチャフェーズが完了するまで、機能するコードは一行も書かれませんでした。

Qwenの悪名高い「冗長性」と「考えすぎる」傾向が、この複雑なタスクにおいては決定的な利点となりました。この慎重な計画優先のアプローチにより、堅牢でプレイ可能な最終製品が保証され、移動、衝突、ゲーム状態の処理において優れた実行力を発揮しました。対照的に、Claudeの純粋な速度は、脆くプレイしにくいゲームを生み出す結果となりました。

この結果は、決定的な違いを浮き彫りにしました。Claudeは大量のJavaScriptを素早く提供しましたが、Qwenの初期の「アーキテクチャ上の先見性」は、大幅にスムーズで、後から構築しやすいゲームを生み出しました。この実用的な結果は、Claudeのベンチマーク上のリードを直接的に覆すものです。

コスト、制御、そしてコンテキスト

Qwenのホスト型推論は、大規模なAI導入における経済的実現可能性を再定義します。入力トークン100万あたり2ドル、出力トークン100万あたり6ドルという価格設定は、Claudeのような競合他社を大幅に下回っており、大量のエージェントワークフローにおいて唯一現実的な選択肢となっています。エージェントは膨大なコードベースを読み込み、モデルを繰り返し呼び出し、タスクを生成し、エラーを検査しますが、Claudeのトークンあたりの高いコストでは、こうしたアクションはすぐに採算が取れなくなります。

経済的な側面を超えて、Qwenはオープンウェイトを通じて比類のない制御性を提供します。企業は独自のインフラストラクチャにモデルをデプロイするという戦略的優位性を獲得し、データのプライバシーと究極のカスタマイズ性を確保できます。完全なQwen 3.8 2.4T-A95Bモデルはマルチノードのデータセンターハードウェアを必要とするため、ほとんどのローカル環境でのデプロイは困難ですが、実用的なQwen 3.8 27Bバリアントであれば、24GB VRAMを搭載したコンシューマー向けGPUでローカル実行が可能です。これにより、Claudeでは不可能な内部的な実験やファインチューニングが可能になります。

しかし、この自由には明確なトレードオフが伴います。Artificial Analysisによると、Qwenの生成速度は毎秒約47〜48トークンと遅く、リアルタイムのインタラクションに影響を与える可能性があります。さらに、このモデルは冗長であることで知られており、簡潔な修正を求めた場合でも「ちょっとした身の上話」を生成しがちです。この冗長性は、深い文脈理解を必要とする複雑な自律型エージェントにとっては有益ですが、より多くのインフラストラクチャと、より遅く慎重なモデルに対する高い許容度が求められます。これはゼロコストの自由ではなく、純粋な速度や即時の洗練さよりも制御性を優先する戦略的な投資です。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

新しいAI意思決定マトリックス

適切なAIモデルを選択するには、単なるベンチマークスコアだけでなく、その運用プロファイルを正確に理解する必要があります。万能な「ベスト」モデルの時代は終わり、開発者はモデルの強みを特定のプロジェクト要件に合わせる必要があります。

即時のコーディングタスク、迅速な修正、または純粋な知能の素早い発揮が最優先される場合には、Claude Opus 5が依然として優れた選択肢です。Artificial Analysisで63というスコアを記録したその速度と洗練された出力は、プロンプトのターンアラウンドが重要な日常的かつインタラクティブな問題において、開発を加速させます。

しかし、洗練されたエージェントワークフロー、複雑なシステムの設計、または予算に敏感なプロジェクトにおいては、Qwen 3.8が決定的な選択肢となります。そのホスティング価格は100万トークンあたり入力2ドル、出力6ドルであり、Claudeの法外なコストとは対照的に、大量の運用を経済的に実行可能です。さらに、Qwenのオープンウェイトへのアクセスは、カスタムデプロイメントにおいて比類のない制御性と柔軟性を提供します。

現在、開発者に不可欠なスキルは、これらの微妙なトレードオフを習得することです。成功は、スピード、コスト、カスタムデプロイメントの間の繊細なバランスを理解し、その仕事に最適な専門ツールを選択できるかどうかにかかっています。この適応的なアプローチを無視すれば、各課題に対して適切なモデルを活用している競合に、プロジェクトがあっという間に追い抜かれることになるでしょう。

よくある質問

ゲーム開発テストでQwen 3.8がClaude Opus 5よりも優れたパフォーマンスを発揮したのはなぜですか?

Qwenは複雑なタスクに対してより慎重で計画的なアプローチをとったため、よりまとまりがあり、プレイ可能なゲームが完成しました。一方、Claudeのより高速なコード先行型のアプローチは、ベンチマークスコアは高いものの、機能面では劣る結果となりました。

Qwen 3.8のようなオープンウェイトモデルの主な利点は何ですか?

主な利点は制御性とコストです。オープンウェイトにより、開発者はモデルを自己ホストしてカスタマイズすることができ、ホストされた推論価格は独自の競合他社よりも大幅に安価であるため、大量のタスクやエージェントタスクに最適です。

Qwen 3.8はClaude Opus 5よりも速いですか、それとも遅いですか?

Qwen 3.8は一般的に遅く、ベンチマークでは毎秒約47〜48トークンですが、Claude Opus 5は約62トークンです。また、その冗長な性質により、単純なクエリではより遅く感じられることがあります。

2.4兆パラメータのQwenモデルを自分のコンピュータで実行できますか?

いいえ、フルサイズの2.4Tモデルを実行するには、マルチノードのデータセンタークラスのハードウェアが必要です。ただし、Qwen 3.8 27Bモデルのような小型バージョンは、約24GBのVRAMを搭載したコンシューマー向けGPUでのローカルデプロイメント向けに設計されています。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only