Skip to content
ai tools

Anthropicの新しいAI:華麗だが欠陥あり

AnthropicのClaude Sonnet 5はベンチマークを打ち破るものの、とんでもなく高価になる秘密を隠しています。実際のコスト、Fableの性能低下した復活、そしてスパイウェア論争について詳しく解説します。

Nora Vance
Anthropicの新しいAI:華麗だが欠陥あり

机上では華麗、実践では欠陥あり

Anthropicは最近、Sonnet 5を発表し、これまでのモデルの中で最もエージェント的なモデルとして売り出しました。4ヶ月半ぶりのこのアップデートは、Opus 4.8に近い性能を大幅に低い価格で提供すると謳っています。Anthropic自身のベンチマークでは、前身であるSonnet 4.6を上回り、知識作業においてはOpus 4.8をもわずかに凌駕することが示されました。

信頼できる情報源であるArtificial Analysisによる第三者ベンチマークは、これらの主張を概ね裏付けています。Sonnet 5は、知能指数においてGPT-5.4とGPT-5.5の間に位置します。決定的に重要なのは、エージェント指数においてGPT-5.5を上回ったことであり、Anthropicがこれらの能力に注力しているという声明を裏付けています。コーディング指数では、Opus 4.8に数ポイント及ばなかったものの、GPT-5.4をわずかに上回り、Sonnet 4.6からの明確な改善を示しています。

Sonnet 5の初期API価格は、特に8月31日まで有効な入力トークン100万あたり2ドル、出力トークン100万あたり10ドルの期間限定割引を考慮すると、競争力があるように見えます。これにより、Gemini 3.5 Flashのようなモデルと真っ向から競合し、生のトークンコストベースではOpus 4.8よりも著しく安価です。割引期間が終了すると、標準料金は入力トークン100万あたり3ドル、出力トークン100万あたり15ドルに戻ります。

非効率性の隠れたコスト

Sonnet 5の低価格に関するAnthropicの主張は、実際にはすぐにほころびを見せます。このモデルは極度のトークン飢餓に苦しんでおり、ライバルよりもタスクあたりはるかに多くのトークンを消費します。例えば、Artificial Analysisの知能指数によると、Sonnet 5はたった1つのタスクに約69,000トークンを使用しました。このトークン消費量は、Sonnet 4.6、Opus 4.8、Fable 5、GPT 5.4、GPT 5.5といった競合モデルを大幅に上回っています。

この非効率性は、Sonnet 5の一見競争力のあるトークンあたりの価格設定を完全に無効にします。100万トークンあたりの料金が低いにもかかわらず、消費されるトークンの絶対量が多いため、タスクあたりの実際のコストは、Anthropicが競合を目指したモデルであるOpus 4.8よりも高くなります。さらに悪いことに、Artificial Analysisによると、同等のタスクでは、より高性能なGPT 5.5のほぼ2倍のコストがかかります。これらのコスト計算には、Anthropicの標準価格が使用されており、期間限定割引は含まれていません。

最終的に、コストパフォーマンスチャートはSonnet 5の明確な経済的劣位をはっきりと示しており、最悪の象限に位置づけています。このモデルは、その性能層に対して高いコストがかかり、ほとんどの現実世界のアプリケーションにとって経済的に実行不可能な選択肢となります。この根本的な欠陥は、いかなるベンチマークの改善をも覆い隠し、Sonnet 5を価値の低い提案にしています。

Fableの復活:ピュロスの勝利か?

AnthropicのFable 5が、一時的な輸出禁止措置を経て、ついに誰でも利用できるようになりました。しかし、まだ喜ぶのは早いです。その有用性は今や疑問視されています。かつて複雑なタスクで最高の性能を誇ったこのモデルは、重大なハンディキャップを負って復活しました。

当初の禁止措置は、Amazonの研究者がFable 5に欠陥を特定し悪用するよう促したセキュリティ脆弱性テストに端を発しています。しかし、Anthropic自身の調査により、古いClaudeバージョンを含むほぼすべての主要モデルが、まったく同じ芸当を実行できることが明らかになりました。このリストには以下が含まれます。

  • Claude Opus 4.8
  • GPT 5.5
  • Kimi K2.7
  • Claude Haiku 4.5
  • Sonnet 4.6

率直に言って、この禁止措置は最初から無意味に見え、広く共有されている能力に対してFableを罰するものでした。

Fable 5を復活させるため、Anthropicはより厳格な安全対策を導入しました。善意によるものですが、この変更はモデルを実質的に「弱体化」させました。特にデバッグやコーディングのようなタスクにおける日常的なリクエストでは、Fable 5が頻繁にOpus 4.8にフォールバックするようになりました。これにより、モデルはベンチマークで性能が低下し、そのピーク性能が損なわれています。Sonnet 5のリリースと関連するAnthropicの更新の詳細については、Introducing Claude Sonnet 5 - Anthropicをご覧ください。皮肉なことに、Fable 5は一部の分析ですでにタスクあたりの費用が最も高いモデルでしたが、今では妥協され、より高価な選択肢となっています。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

欺瞞的なコードのパターン?

Sonnet 5の残念な経済性とは別に、Anthropicのモデルに関する透明性の欠如が問題となっています。Claude Codeは、データの隠蔽に用いられる高度な技術であるステガノグラフィーを利用して、密かに使用状況をフィンガープリントし、不正アクセスを追跡しています。

コードは特定の条件をチェックします。例えば、タイムゾーンが中国であるか、APIベースURLが既知のAIラボのホスト名と一致するかどうかです。これらには以下が含まれます。

これらの条件が満たされると、モデルは出力をごくわずかに変更します。日付文字列のハイフンがスラッシュに変わったり、「Today's」のアポストロフィが視覚的には同じだがプログラムで検出可能な別のUnicode文字になったりする可能性があります。この巧妙かつ秘密裏な方法は、APIリセラー、不正なClaude Codeゲートウェイ、およびモデル蒸留攻撃を特定することを目的としています。

Sonnet 5の極端なトークン消費と誤解を招く価格設定から、Claude Codeの隠れた追跡メカニズムに至るまで、モデルが実際にどのように動作するかを不明瞭にするこのパターンは、非常に懸念されます。Anthropicは、そのAI製品の技術的および財政的現実について正直ではありません。強力なAIツールに投資する顧客は、完全な明確さと誠実な条件を受ける権利があります。

よくある質問

Claude Sonnet 5はベンチマークが良いのに、なぜ期待外れと見なされるのですか?

ベンチマークで高い性能を示すにもかかわらず、Sonnet 5は非常に非効率的で、タスクあたりに大量のトークンを使用します。このため、実際のコストはOpus 4.8やGPT-5.5のようなより高性能なモデルよりも大幅に高くなります。

Fable 5は禁止される前と同じですか?

いいえ。輸出規制は解除されましたが、Anthropicはより厳格な安全対策を導入しました。これにより、Fable 5はより日常的なタスクでOpus 4.8にフォールバックするようになり、一部のベンチマークでの性能が実質的に「弱体化」しています。

Claude Codeに関するスパイウェア疑惑とは何ですか?

Claude Codeには、中国のタイムゾーンからの使用や不正なAPIリセラーを介した使用を検出するためにステガノグラフィーを使用する隠れた機能が含まれています。出力のフィンガープリントを作成するために、日付文字列や句読点を微妙に変更します。

Sonnet 5はOpus 4.8よりも安いですか?

書面上では、トークンあたりの価格は低いです。しかし実際には、Artificial Analysisによる第三者分析では、Sonnet 5のタスクあたりのコストは、その低いトークン効率のためにOpus 4.8よりも実際には高いことが判明しました。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only