巧妙なトリック:平均的なマシンではなく、Macをベンチマークする
llama.cppやOllamaのようなエンジンは、プリコンパイルされたカーネルを提供します。これにより移植性が最大化され、1つのビルドで多様なチップに対応できます。しかし、この利便性の代償として、特定のデバイスにおけるパフォーマンスが犠牲になることがよくあります。
Magnitudeは異なるアプローチをとります。モデルをダウンロードすると、Mac上で直接一連のマイクロベンチマークを実行します。さまざまなカーネル構成をテストして時間を計測し、最も高速なものをキャッシュします。このデバイス内チューニングプロセスには約1分かかるとされています。
パフォーマンスの主要な指標として、プリフィル(prefill)とデコード(decode)の2つに遭遇します。プリフィルはエンジンがプロンプトを処理する速度を測定し、デコードはトークンが1つずつ生成される速度を追跡します。
インタラクティブなエージェントワークフローでは、コーディングエージェントの出力ストリーミングを待つ際など、デコード速度の方がより顕著な要因となります。Magnitudeの「2倍の速度」という主張は、特にこのデコードパフォーマンスを対象としています。
エージェント向けに構築され、接続も驚くほど簡単
実用的なセットアップは簡単です。「Discover」タブから推奨モデルを選択してダウンロードすれば、Magnitudeが約1分間かけてチューニングを行います。その後、Claude Code、Codex、OpenCode、Cline、またはPiをローカル互換API経由で接続します(OpenAIとAnthropicのAPIエンドポイントはどちらもlocalhostで公開されます)。
Magnitudeのエージェントに特化した設計が差別化要因です。エンジンはマルチセッションワークフロー向けに最適化されています:
- セッション間でのプロンプトキャッシュの共有
- 動的なメモリ管理
- 圧縮されたKVキャッシュ(キーは8ビット、値は4ビット)
- アイドル時のモデルアンロード
これにより、Magnitudeは独自の立ち位置を確立しています。llama.cppとOllamaは幅広いハードウェアへの対応を優先し、MLXはApple Siliconに特化しています。vLLMのようなサーバーエンジンは、データセンターでの推論におけるバッチ処理をターゲットにしています。一方、Magnitudeはローカルでのチューニングとエージェントワークフローに焦点を当てています。ユーザーの正確なマシンを測定し、それに合わせてチューニングを行い、長時間稼働するエージェントを中心に構築します。このアプローチは、ローカルAIアシスタントを実行する開発者にとって明確な利点をもたらします。
「ほぼ2倍」という結果がすべてを物語っているわけではない
Magnitudeの「2倍」という主張のヘッドラインテスト結果にはニュアンスが含まれています。M4 Proにおいて、Qwen 3.6 35B A3B(4ビット、64Kコンテキスト)はデコードで毎秒57トークンを記録し、llama.cppの30 t/sに対して92%の向上を見せました。しかし、プリフィルは9%の向上にとどまりました。「2倍」という数字は、主にデコード中心の指標です。
この比較は普遍的なものではありません。Nvidia DGX Sparkで同じテストを実行した場合、デコードの向上率は19%に低下しました。重要な点として、M4 ProのテストではKVキャッシュの構成が異なっていました。llama.cppの圧縮キャッシュパスが機能せず、フル16ビットキャッシュの使用を余儀なくされたのに対し、Magnitudeはデフォルトの圧縮キャッシュを使用しました。
独立したレポートにより、状況はさらに複雑になっています。一部のユーザーはMLXやllama.cppの方が高速であると報告しています。報告には、M5 MaxやRTX 5070 Tiでllama.cppがMagnitudeを上回った例や、M5 MaxでMLXがMagnitudeを上回った例(175 t/s対161 t/s)が含まれています。ハードウェア、モデル、および特定の設定がパフォーマンスを決定づけることは明らかです。より詳細な技術的分析については、GitHub - magnitudedev/magnitude: Open source inference engine for agentsリポジトリを確認してください。
Magnitudeはまだ初期段階(v0.2.5)であり、開発者はM5の新しいMetal Matrixハードウェアをまだ活用していないと述べています。プロジェクトが成熟するにつれて、より多くの独立したMLX比較が登場することが期待されます。生の速度に関する主張は注目を集めますが、多様なハードウェアやワークロード全体で真実を物語ることは稀です。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
誰がインストールすべきか、誰が待つべきか
バージョン0.2.5のMagnitudeは、初期段階の実験的プロジェクトです。ローカルコーディングエージェントを実行しているM1〜M4 Macユーザーはインストールを検討すべきです。Claude Code、Codex、OpenCode、Cline、またはPiへのワンクリック接続は非常に魅力的であり、エージェントのワークフローにおいては、純粋なスループットの向上よりも大きな価値をもたらすことが多々あります。
未完成な部分があることを想定してください。厳選されたカタログには約15のモデルが用意されており、すべて4ビット以上です。カスタムGGUFに関するガイダンスはなく、ダウンロードされたモデルはユーザーのホームディレクトリに隠され、アイドル状態からのアンロードにより最初の応答が遅くなることがあります。これらは、試行錯誤を楽しむユーザーにとっては些細な摩擦に過ぎません。
最高速度を追求するM5ユーザーは、今のところMLXを使用し続けるべきです。MagnitudeはまだM5の新しいMetal Matrixハードウェアを活用していません。本番環境への導入には忍耐が必要です。導入を決定する前に、より広範な独立した比較結果を待つことをお勧めします。
ここでの永続的なアイデアは、2倍の性能向上を保証することではなく、デバイス測定によるチューニングです。特定のハードウェアに合わせてカーネルを最適化するMagnitudeのアプローチは、ローカルLLMを実行するためのより賢明な方法です。M4 ProでQwen 3.6 35B A3B、64Kコンテキストを使用した場合の92%のデコード向上という結果がすべてに当てはまるわけではありませんが、その原則は確かなものです。
よくある質問
Magnitudeとは何ですか?
Magnitudeは、コーディングエージェントとハードウェア固有のカーネルチューニングを中心に設計された、オープンソースのローカル推論エンジンです。
Magnitudeは本当にllama.cppの2倍の速さですか?
あるM4 Proのテストではデコード速度がほぼ2倍を記録しましたが、独立した結果はハードウェア、モデル、構成によって異なります。
MagnitudeはどのようにMacに合わせて調整されますか?
デバイス上でさまざまなカーネル構成をベンチマークし、最も高速なオプションを選択して、後の使用のためにキャッシュします。
MagnitudeはClaude Codeに接続できますか?
はい。OpenAIおよびAnthropic互換のローカルAPIにより、Claude Codeやその他のエージェントツールへのワンクリック接続をサポートしています。
今、誰がMagnitudeを試すべきですか?
コーディングエージェント用のシンプルなローカルバックエンドを求めるM1からM4のMacユーザーは役立つかもしれません。本番環境で利用するユーザーは、さらなる比較結果を待つべきです。

