Skip to content
research

Claudeの南北戦争:Opus 5がFableを王座から引きずり下ろす

Anthropicの新しいOpus 5モデルは、単なるアップグレードではありません。AIのコストパフォーマンス曲線を再定義する戦略的なクーデターです。しかし、最も衝撃的なのは、モデルをさらに賢くするために意図的に削除された機能です。

Aki Tanaka
Claudeの南北戦争:Opus 5がFableを王座から引きずり下ろす

ベンチマークの血の海

Anthropicの新しいOpus 5は、AIの勢力図を劇的に塗り替えました。フラッグシップモデルであるFable 5を、ほぼすべての重要なベンチマークで予想外に上回ったのです。以前のミドルティア製品の後継であるこのモデルは、Claudeのモデルファミリーにおける既存のヒエラルキーを覆し、新たな基準を打ち立てました。

パフォーマンスの向上は顕著です。Opus 5は、エージェント型ターミナルコーディングのFrontier Benchで10ポイントの飛躍を遂げ、Fable 5の33に対し43を記録しました。実用的なタスクのベンチマークであるOpenAIのGDP Valでは、100ポイントという驚異的な改善を実現しました。また、Arc AGI 3でも大幅な飛躍を遂げ、従来の最高値である約8%から30%にまで到達しました。

その能力をさらに裏付けるように、Opus 5はコンピュータ使用のOS Worldで4ポイント、Automation Benchで9ポイントの向上を示しました。また、Browse CompでもFable 5を上回り(90%対87%)、幅広い能力を実証しました。

しかし、Opus 5には専門的な能力プロファイルがあります。Deep Sweeベンチマークではわずかな低下が見られ、法務ベンチマークでも(13.3から11.7へ)減少しました。Health Bench Professionalでも低下が見られ、Opus 5は多くの分野で優れているものの、その強みがすべての領域で均一に分布しているわけではないことを示唆しています。

新たな結論:タスクあたりのコスト

AIの有用性を測る単純な指標として長年使われてきたトークン単価は、真の運用コストを見誤らせる可能性があります。価値を決定づける真の指標は、トークン価格とモデル効率の両方を考慮した包括的な尺度であるタスクあたりのコストです。トークン単価が半分のモデルでも、消費量が2倍であれば実際のコストは変わらないということが、Kimmy K3と競合他社の比較から明らかになっています。

OS WorldやAutomation Benchなどの性能対コストチャートの分析は、Opus 5の優位性を明確に示しています。Y軸に合計スコア、X軸にタスクあたりのコストをとったOS Worldにおいて、Opus 5は一貫してグラフの左上方に位置しています。これは、Fable 5やOpus 4.8と比較して、優れたパフォーマンスと低コストの両立を示しています。

GPT 5.6 Solと比較しても、Opus 5は驚異的な経済効率を発揮します。GPT 5.6 SolのユーザーがOpus 5と同等のパフォーマンスを得るには、2倍以上のコストがかかる可能性があります。これは具体的なメリットに直結します。ユーザーは、より有能なモデルを手に入れ、同じ、あるいはそれ以下のコストでより確実にタスクを完了できるのです。Opus 5は、単なるベンチマークスコアを超え、実証可能な価値を提供するAIの経済的実現可能性における重要な飛躍を象徴しています。

推論における飛躍的進歩

Opus 5の最も際立った進歩は、その純粋な推論能力にあります。これはArc AGI 3ベンチマークで前例のない30%というスコアを記録したことからも明らかです。これは、従来の最高値であった約8%からの記念碑的な飛躍です。Arc AGI 3テストは、純粋なゼロショットの課題解決能力を測定します。モデルには指示やコンテキストが一切与えられず、タスク環境のみが提供されます。これは、人間が全く新しいパズルに直面したときのように、自律的にルールを推論し、目標を達成することを求めるものです。

この推論における根本的な飛躍は、複雑なエンタープライズアプリケーションの機能強化に直結します。Sponsor Boxの内部調査により、Opus 5が要求の厳しい多段階のナレッジワークにおいて、従来のモデルを凌駕する大幅な向上を実現していることが確認されました。本モデルは、以下のような重要な分析タスクにおいて優れたパフォーマンスを発揮します。

  • デューデリジェンス
  • データ分析
  • データに基づくレポート作成

これらの徹底的な分析は、多様な業界において堅牢で現実的なビジネス上の意思決定を推進するために不可欠です。

未知の問題を解決できるモデルは、より自律的なAIエージェントに向けた基礎的な一歩です。AIがコンピュータを制御し、インターフェースを操作する能力(要素の特定、ボタンのクリック、タスクの実行など)を評価するOS Worldのようなベンチマークにおいて、Opus 5がスコアを向上させたことは、洗練されたagentic workflowsへの準備が整ったことを示しています。この機能により、AIは単なるタスク実行を超えて、動的な環境下で真の問題解決を行い、ツールやコンピュータを効果的に操作できるようになります。機能の詳細については、Introducing Claude Opus 5 - Anthropicをご覧ください。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

引き算による賢明化

Opus 5の最も直感に反する設計上の決定は、surgical nerf(外科的な能力制限)を伴うものでした。サイバーセキュリティの脆弱性攻撃能力を意図的に削減したにもかかわらず、全体的な知能は向上したのです。Opus 5は「脆弱性攻撃の開発においてMythos 5に大きく遅れをとっている」一方で、逆説的に一般的なサイバーセキュリティタスクでは前モデルのOpus 4.8を上回っています。これは戦略的な剪定を示唆しており、有害または周辺的な能力を制限することで、中核となる推論能力へのより深く洗練された集中を可能にしました。

この選択的な引き算は、安全ガードレールを追加すると必然的にモデルの一般的なパフォーマンスが低下するという長年の信念に異議を唱えるものです。むしろ、これはAI alignmentに対するより洗練されたアプローチを示唆しています。ターゲットを絞った制約は、気を散らすものを取り除くのと同様に、リソースをより生産的な認知経路に再配分することで、有益な知能の純増を促進する可能性があるのです。

Anthropicは、この「安全第一」の哲学を、堅牢な本番環境での利用を想定した開発者向けの新しい機能でさらに強化しました。これには、安全フラグが立てられたリクエストに対する自動APIフォールバックが含まれており、機密コンテンツが検出された場合でもシームレスな運用を保証します。さらに、会話の途中でツールを変更できる機能により、モデルの適応性と信頼性が向上し、開発者はアプリケーションにおいてより高い制御性と安定性を得ることができます。

よくある質問

Claude Opus 5とは何ですか?

Claude Opus 5は、Anthropicによる最新の最高峰モデルです。驚くべきことに、前モデルのOpus 4.8と同じ価格を維持しながら、ほとんどのベンチマークで前フラッグシップモデルのFable 5を上回る性能を発揮します。

Opus 5はFable 5と比べてどのように優れていますか?

Opus 5は、エージェント型コーディング(Frontier Bench)、現実世界のタスク完了(GDP Val)、未知の問題解決(Arc AGI 3)などの分野で、Fable 5を大幅に上回る成果を見せています。また、タスクあたりのコストも低く抑えられており、より効率的です。

AIモデルにおける「タスクあたりのコスト」とはどういう意味ですか?

タスクあたりのコストとは、トークン価格と必要なトークン数の両方を考慮した、仕事を完了させるための真の価格です。モデルのトークン単価が安くても、効率が悪ければコストは高くなります。Opus 5は非常に高い有効性を備えているため、成功したタスクあたりの全体的なコストを削減できるという点で優れています。

Opus 5はすべてにおいて優れていますか?

いいえ。全体的にはより高い能力を備えていますが、Opus 5は法務(Legal Bench)や専門的な医療(Health Bench Professional)といった特定の専門的なベンチマークにおいて、わずかな性能低下が見られます。また、サイバーセキュリティの脆弱性開発については、意図的に能力を抑えるよう設計されています。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only