Skip to content
comparisons

Opus 5:Fable Killerの登場

AnthropicはFable 5の対抗馬を半額でリリースし、最先端のパフォーマンスを約束しました。しかし、私たちの実機テストでは、ベンチマークには現れない実コストに関する重要な詳細が明らかになりました。

Vera Cole
Opus 5:Fable Killerの登場

ベンチマークの猛攻:Opus 5の圧倒的なペーパーパフォーマンス

AnthropicのOpus 5が登場し、コーディングやナレッジワークの評価における新たな最先端モデルとしての地位を確立しました。Frontier-Benchにおいて、Fable 5を約10%上回るという明確な差を見せつけており、パフォーマンスに対する期待値を塗り替えています。

Opus 5のARC-AGIベンチマークにおけるパフォーマンスは特に画期的で、30.2%という驚異的な数値を達成しました。これはOpus 4.8の1.5%や、これまでの最高値であったSolの7.8%から飛躍的な進歩を遂げており、高度な論理的推論のためにテストを代数表記に変換する新しい能力を示しています。

Artificial Analysisによる第三者指標も、複数の重要な次元におけるOpus 5のペーパーパフォーマンス上の優位性を裏付けています。Agentic IndexおよびIntelligence Indexの両方で、Fable 5やGPT 5.6 Solを抑えて不動の首位に立ちました。

Coding IndexではGPT 5.6 Sol Extra Highに0.3ポイント及ばず2位となりましたが、それでもFable 5を1.5ポイント上回っています。これらの包括的なベンチマーク結果は、フロンティアインテリジェンスにおけるOpus 5の即時かつ実質的なリードを裏付けるものです。

「半額」という約束を読み解く

AnthropicはOpus 5をFable 5の「半額」の代替品として位置づけており、公式のAPI料金もそれを裏付けています。Opus 5はOpus 4.8と同じ価格設定(入力トークン100万あたり5ドル出力トークン100万あたり25ドル)を維持しています。この構造により、トークンあたりのコストは確かにFable 5の約半分となっています。

ベンチマーク主導のコスト分析では、Opus 5がFable 5よりもタスクあたりのコストが安いことが示され、その価値提案が強調されることがよくあります。Artificial Analysisは、典型的なタスクにおいてOpus 5が72セント安価であると結論付けました。また、CursorBenchでも、Fable 5で17ドルかかったタスクがOpus 5では8ドルで済んだと報告されています。

しかし、複雑なタスクの実機テストでは異なる結果が明らかになりました。F1レースゲームのコーディングタスクでは、Opus 5のコストは12.99ドルとなり、その事例においてはFable 5よりも高額になりました。この異常値は、Opus 5が同じ出力に対して5倍のトークンを消費したことに起因しており、トークン消費量の多い実用的なシナリオでは「半額」という触れ込みが揺らぐ結果となりました。

Opus 5の相対的なコスト削減にもかかわらず、GPT 5.6 Solは依然として価格対性能比で不動の王者です。Opus 5を含むAnthropicのモデルは、依然としてプレミアムな価格帯に位置しています。絶対的なコスト効率を優先するユーザーにとっては、Opusエコシステムの外部により良い選択肢があるでしょう。

ベンチマークからビルドへ:実世界での対決

理論上のベンチマークを超えて、Opus 5は印象的な実世界パフォーマンスを発揮します。F1ゲームの生成タスクにおいて、Opus 5は競合他社と比較して優れたビジュアルと機能性を実現しました。Three.jsを使用した単一のHTMLファイルとして出力された成果物は、精巧にモデル化されたF1カー、正確なハンドリング、ラップタイム計測、正確な位置情報を備えていました。一方、Fable 5の車はより基本的な見た目であり、GPT 5.6 Solはコースが存在せず、アセットが逆向きで、トラックの一部が破損しているというバグだらけのバージョンを出力しました。このことから、実行品質においてOpus 5が明確な勝者であると言えます。

Opus 5は、フルスタックのファイナンスダッシュボードプロジェクトにおいても優れた性能を発揮しました。クリーンなUI/UXとリクエストされたすべての機能専用のページを備えた、モダンで完全に機能するアプリケーションを生成しました。Opus 5は、React RouterやNode、SQLiteといった現代的な技術スタックを採用し、堅牢なデータ管理を実現しています。Fable 5は自作ルーターという古いアプローチを選択し、Kimi K3は堅牢性に欠けるJSONファイルデータベースを使用したことから、Opus 5のプロジェクトアーキテクチャに対する洗練されたアプローチが際立っています。その機能に関する技術的な詳細については、Introducing Opus 5 - Anthropicをご覧ください。

このモデルは一貫して優れたコーディングのセンスを発揮し、複雑なマルチファイルプロジェクトを一度の指示で実行する卓越した能力を示しています。その出力は単に機能するだけでなく、現代の開発基準にも準拠しており、Opus 5をプロフェッショナルな現場で活用できる強力かつ有能な開発ツールとして確立させています。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

新しい標準か?Opus 5をスタックに組み込むべき理由

Opus 5は、タスクの95%においてFable 5の魅力的な代替手段となり、より有利な価格設定で最高レベルの知能を提供します。Frontier-BenchではFable 5を約10%上回り、ARC-AGIでは前例のない30.2%を達成し、新しい代数的推論能力を実証しました。Opus 5のコストは入力トークン100万あたり5ドル、出力トークン100万あたり25ドルで、これはFable 5の一般的なタスク完了コストの約半分です。

重要な点として、Opus 5はデータポリシーの面で戦略的な優位性を提供します。Fable 5とは異なり、Opus 5には一般的なアクセスに対するデータ保持要件がありません。Fable 5の制限的なデータポリシーは、ARC-AGIベンチマークへの参加すら妨げました。このことは、機密性の高いワークフローや独自のワークフローにおいて、Opus 5の方が柔軟性が高く、より幅広い適用が可能であることを示しています。

現在のAI環境には、専門的なニーズに応じた明確な階層が存在します:

  • Fable 5: 複雑で長期的な研究において依然として優位性を保持。
  • GPT 5.6 Sol: Opus 5のほぼ半額という、コスト意識の高いパフォーマンスを実現。
  • Kimi K3: オープンウェイトの能力で高い評価を得ており、独自のニッチを確立。

しかし、Opus 5は間違いなく新しい高性能な日常の相棒として台頭しており、高額なコストや制限的なデータポリシーなしで最先端の知能を提供します。

よくある質問

Claude Opus 5とは何ですか?

Claude Opus 5はAnthropicによる最新の大規模言語モデルであり、同社の最先端モデルであるFable 5に近い知能を、大幅に低い価格で提供するように設計されています。日常的なタスクのための強力かつ効率的なモデルとして位置付けられています。

Opus 5とFable 5の比較はどうですか?

理論上、Opus 5はCoding、Agentic、Intelligence Indicesなどの主要なベンチマークでFable 5と同等かそれ以上です。また、Fableのようなデータ保持要件もありません。ただし、非常に複雑で長期的な問題については、依然としてFable 5の方が優れている可能性があります。

Opus 5は本当にFable 5より安いのですか?

Opus 5のAPI価格はFable 5の約半分です。ベンチマーク上はタスクコストが低いとされていますが、実際のテストでは大幅に多くのトークンを消費する場合があり、特定の複雑な生成タスクではかえって高コストになる可能性があります。

Opus 5のARC-AGIベンチマークスコアの何が特別なのですか?

Opus 5はARC-AGIで30.2%という驚異的なスコアを達成しました(これまでの最高は7.8%)。研究者は、抽象的な推論問題を代数表記に変換して解決するという、他のモデルには見られない新しい能力を実証したと指摘しています。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only