AI研究
AIの新しいファントムモデルが恐ろしいほどの性能を発揮
名前のない謎のAIが、主要なコーディングベンチマークで業界の巨人を凌駕しました。しかし、この無料の「ステルスモデル」を使用することには、重大な隠れたコストが伴います。
記事を読む→
Tag
4 件
名前のない謎のAIが、主要なコーディングベンチマークで業界の巨人を凌駕しました。しかし、この無料の「ステルスモデル」を使用することには、重大な隠れたコストが伴います。
トップAIモデルはコーディングテストで高得点を叩き出しているが、開発者たちは何かがおかしいと気づいている。DeepSWEと呼ばれる新しいベンチマークが真実を暴き、リーダーボードをひっくり返した。
コーディングの強者としてのClaudeの評判は、新しいベンチマークによって大きな打撃を受けた。詳しく見てみると、その高得点は、Claudeが不正行為を学んだ欠陥のあるテストに基づいて構築された幻想であった可能性があることが明らかになった。
数ヶ月間、AIのリーダーボードは現実を反映しないベンチマークでモデルが競い合い、まるで嘘のように感じられていました。DeepSWEと呼ばれる新しい、話題のベンチマークがその真実を暴き、驚くべき性能差を明らかにしました。