Skip to content
ai agents

2Bモデルが4BのTitanを凌駕。そこに潜む罠とは。

わずか2Bパラメーターの小型モデルが、複雑なコーディングタスクにおいて2倍のサイズの巨大モデルを凌駕し、ローカルAIエージェントの新たな時代の到来を告げています。しかし、そのドキュメントの奥深くに隠されたある一つの設定が、このモデルを完全に使い物にならなくしてしまう可能性があります。

Sol Aguirre
2Bモデルが4BのTitanを凌駕。そこに潜む罠とは。

4Bのライバルをコーディングで凌駕した2Bモデル

OpenBMBが開発した20億パラメーターのモデル「MiniCPM5-2B」が、最近の「SWE-bench Verified」ベンチマークで衝撃的な番狂わせを演じました。同モデルはスコア46を記録し、40億パラメーターの「Qwen3.5-4B」(スコア34)を決定的に打ち負かしました。このパフォーマンスは、モデルの規模に関する従来の常識を覆し、2倍のサイズのライバルを追い抜くことで、「大きいことは良いことだ」という概念に挑戦しています。

この飛躍は、同クラスのサイズと比較するとさらに重要性が際立ちます。他の20億パラメーターモデルである「Qwen3.5-2B」や「Gemma-4-E2B」のスコアはそれぞれ5と2でした。MiniCPM5-2Bは単に勝利しただけでなく、小型モデルが達成可能な領域を再定義し、特にリソースが制限された環境において、効率的でデプロイ可能なAIの新たなフロンティアを示しました。

SWE-benchは単なる学術的な演習ではなく、機能的なコードパッチを生成することで、モデルが「実際のGitHubの課題」を解決する能力を厳格にテストするものです。これはチャットの流暢さや理論的な理解度を問うものではなく、複雑なソフトウェア環境における実践的かつエージェント的な問題解決能力を評価するものです。このレベルで動作する2Bモデルは、「AIエージェントの能力」における重大な転換点を示しており、抽象的な可能性から開発者にとって具体的かつ検証可能な成果物へと移行しています。

エージェントのために構築された設計

MiniCPM5-2Bの驚異的なパフォーマンスは偶然ではありません。これはモデル設計における深い転換を象徴しています。OpenBMBは、教師ありファインチューニング中に50万件のエージェント軌跡を学習させることで、一般的なチャット能力を超えた「エージェント的な振る舞い」のためにトレーニング体制を明示的に構築しました。この厳格なプロセスには高度な強化学習が組み込まれており、最終的に16個の個別のRLエキスパートモデルを統合して、高度に専門化された単一のエージェントが完成しました。

アーキテクチャ面において、MiniCPM5-2Bは実用的かつ強力な決断を下しています。それは「Llamaベース」を採用したことです。これは斬新なコンポーネントを発明することではなく、以前の反復で見られたカスタムのスパースアテンションを排除し、ユーティリティと到達範囲を最大化することに重点を置いています。この戦略的な選択により、モデルは以下のような多様な環境でシームレスに動作する高い互換性を獲得しました。

  • MLX
  • Llama.cpp
  • WebLLM

これにより、エージェントシステムを構築する開発者の参入障壁が大幅に引き下げられました。

重要なことに、MiniCPM5-2Bの技術仕様は、そのエージェントとしての能力をさらに裏付けています。同モデルは、状態を維持し、長期にわたるタスクシーケンスを理解するために不可欠な「128,000のネイティブコンテキストウィンドウ」を備えています。Apache 2.0ライセンスの下でのリリースとオープンデータセットの提供は、透明性と幅広い採用を促進し、新しいエージェントアプリケーションの基盤となるピースとなっています。

一つの悪いデフォルト設定がすべてを台無しにする

デフォルト設定で「量子化された4-bit GGUFモデル」を実行すると、MiniCPM5-2Bの重大な欠陥が露呈します。ベンチマークでの優れた性能にもかかわらず、このモデルは92%以上の確率で壊滅的な繰り返しループに陥り、エージェントタスクには事実上使い物にならなくなります。一般的なデフォルト設定によって引き起こされるこの本質的な不安定さが、当初はモデルの真の可能性を隠していました。

当時ドキュメント化されていなかった単純な修正によって、この不安定な挙動は一変します。サンプラー設定を変更し、具体的には「min_p」を0に設定するか、「repeat_penalty」を1.15に設定することで、MiniCPM5-2Bの潜在能力が解放されます。HumanEval+において、Q4_KM量子化バージョンはこれらの特定の調整を行うことで、悲惨なスコア6から驚異的な71へと跳ね上がり、その劇的な感度の高さが浮き彫りになりました。

これは単なるパラメータ調整ではなく、効率的なAIのための根本的な設計上の考慮事項です。MiniCPM5-2Bのような小規模で高度に調整されたモデルにとって、サンプラー設定はもはや単なる「チューニング」ではなく、モデルの機能設計における重要な要素です。これらの重要なデフォルト設定を無視すると、本来強力なエージェントが完全に機能しなくなる可能性があり、これらのシステムがいかに緻密に最適化されているかを物語っています。OpenBMBによるこれらのアーキテクチャに関する継続的な取り組みについては、GitHub - OpenBMB/MiniCPM: MiniCPM5: SOTA on-device LLMs, small yet powerful. リポジトリをご覧ください。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

現実的な検証:4Bモデルが依然として優位な理由

MiniCPM5-2Bは驚異的なエージェント能力を備えていますが、専門的なニッチ分野から一歩外に出ると大きな限界に直面します。SWE-bench VerifiedではQwen3.5-4Bを上回る決定的なスコアを記録しましたが、より広範で多様な指標ではパフォーマンスが低下します。SWE-bench Proにおいて、MiniCPM5-2Bのスコアは14であり、Qwen3.5-4Bの28のちょうど半分です。Terminal-Benchではさらに顕著な差が見られ、MiniCPM5-2Bが約8.5であるのに対し、Qwen3.5-4Bは26と、3倍の開きがあります。

重要な点として、OpenBMBのベンチマークはベンダー自身によって実施されたものであり、限定的で精選された見方しか提示していません。比較表にはQwenとGemmaモデルのみが掲載されており、より広範なエコシステムにおける主要な競合他社が意図的に除外されています。以下のモデルに関するパフォーマンス指標はありません:

  • Llama
  • Phi
  • SmolLM3
  • MiniCPM4(前モデル)

このような透明性の欠如と、コミュニティから要求されている評価スクリプトが公開されていない現状は、競争環境全体に対する疑問を投げかけています。

MiniCPM5-2Bは、特にMacBook Airのようなオンデバイスアプリケーションにおけるローカルエージェントの実験にとって魅力的な飛躍を遂げました。その高度に特化したトレーニングにより、特定のコーディングやツール使用タスクにおいて強力なツールとなっています。しかし、Qwen3.5-4Bが勝利しているMMLU-Pro、GPQA Diamond、LongBench V2を含む、より多様なタスク全体で信頼性の高いパフォーマンスを求めるならば、より大型のQwen3.5-4Bの方が間違いなく優れており、堅牢な選択肢です。小型モデルは可能性を示していますが、依然として大型モデルが中心的な役割を担っています。

よくある質問

MiniCPM5-2Bとは何ですか?

MiniCPM5-2Bは、OpenBMBが提供する25億パラメータのオープンソース言語モデルです。AIエージェントタスク向けに特別にトレーニングされており、幅広い互換性を確保するために標準的なLlamaアーキテクチャを採用しています。

MiniCPM5-2Bと大型のQwen3.5-4Bはどのように比較されますか?

MiniCPM5-2Bは、SWE-bench Verified(46対34)のような特定のエージェントベンチマークではQwen3.5-4Bを上回ります。しかし、SWE-bench Pro、MMLU-Pro、Terminal-Benchなどの他のベンチマークでは大型のQwenモデルの方が大幅に高いスコアを出しており、全体的な能力ではQwenが勝っています。

量子化されたMiniCPM5-2Bがループに陥るのはなぜですか?

量子化されたGGUFバージョンは、Llama.cppなどのフレームワークにおけるデフォルトのサンプラー設定が不適切なため、90%以上の確率で無限ループに陥る可能性があります。min_pを0に設定するか、repeat_penaltyを約1.15に設定することで解決しますが、これはリリース時に明確に文書化されていませんでした。

MiniCPM5-2Bがエージェントタスクに優れている理由は何ですか?

その強力なエージェントパフォーマンスは、専門的なトレーニングによるものです。これには、50万件のエージェント軌跡を用いた教師ありファインチューニング、強化学習、そして16個の個別のRLエキスパートモデルを1つに統合する作業が含まれています。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

ビルダーの方へ

このページは、他社のツールのために働いています。

AIエージェントが読み、購入検討層がたどり着きます。8言語とMCP経由で答えます。あなたのツールにも同じページを — 24時間以内に公開。