答えではなく、命令を与えるAI
Cactus Computeは、4500万パラメータの画期的なAIモデル「Needle 2」を発表しました。この14MBのコンパクトなモデルは、10ドルのESP32-S3マイクロコントローラ上で完全にオフライン動作し、クラウドに依存しないオンデバイス・インテリジェンスの可能性を押し広げます。Apache 2.0ライセンスでオープンソース化されたNeedle 2は、極めて制約の多いエッジAIにおける新たなパラダイムを示しています。
重要な点として、Needle 2は特化したツール呼び出しディスパッチャー(tool call dispatcher)として機能します。汎用チャットボットとは異なり、自然言語のコマンドを解釈して、あらかじめ定義されたデバイス機能を実行します。例えば、スマートデバイスに「赤いライトを3秒間点滅させて」と指示すると、Needle 2はそれをLEDの制御、サーボの回転、あるいは複雑なモバイルやスマートホーム操作に必要な正確なアクションシーケンスに変換します。
この驚異的な効率性は、意図的かつ決定的なトレードオフから生まれています。Cactus Computeは、幅広い一般知識や会話能力を犠牲にしました。Needle 2は「フランスの首都はどこ?」といった事実に関する質問には答えられません。その代わり、トレーニングデータのすべてをデバイスの動作を可能にすることだけに集中させています。これにより、Needle 2は情報検索ではなく直接的なアクションと制御の専門家となり、専用デバイスのインテリジェンスとして極めて小さなフットプリントと高い効率を実現しています。
CactusはいかにしてLLMアーキテクチャをハックしたか
Cactus Computeは、コンパクトなサイズと効率性を実現するために、Needle 2に斬新なアーキテクチャを採用しました。主な革新は、トークンごとに膨大な行列演算を必要とする従来の学習可能な重みを、ハッシュ化されたn-gramルックアップテーブルに置き換えたことです。この設計により、モデルは計算コストの高い計算を実行する代わりに、メモリから直接知識を検索できるようになり、浮動小数点演算(FLOPs)を従来のモデルの460 MFLOPsからわずか70 MFLOPs/トークンへと劇的に削減しました。
ネットワークをさらに最適化するため、Cactusは標準的なMLP(多層パーセプトロン)層をアダマール変換に置き換えました。従来のMLP層は、巨大で学習可能な行列を使用してネットワークの混合を行いますが、これはモデルのパラメータ予算の大部分を消費します。固定された数学的操作であるアダマール変換は、この不可欠な混合を「無料」で提供し、学習可能なパラメータをほとんど必要としないため、数百万ものパラメータを節約できます。
Needle 2の効率性のパズルを完成させる最後のピースは、独自のCactus Quantsを活用した、トレーニング段階からの2ビット量子化です。多くの小型モデルは、トレーニング後に量子化を行うと、そのような過酷な圧縮を想定して設計されていないため、パフォーマンスが著しく低下します。しかし、Needle 2は最初から独自の2ビット圧縮を前提にトレーニングされているため、最適なパフォーマンスを確保し、超低精度での品質低下を排除しています。つまり、デプロイされる2ビットモデルは、トレーニングされたモデルと同一のものです。
5倍のサイズの巨人を凌駕する
Needle 2は、「モデルが大きいほど性能が優れている」という概念に挑戦します。Cactus Computeの4500万パラメータモデルは、2ビット精度で動作し、5〜7倍のサイズを持つLFM2.5 230Mのようなモデルと互角に渡り合い、特定の難易度の高いツール呼び出しテストではそれらを打ち負かしています。LFM2.5が16ビット精度で動作していることを考えると、このパフォーマンスは特に驚異的です。
その専門領域を考慮すると、Mobile Actions benchmarkにおいて、Needle 2は正しい関数名の選択で98.3%という驚異的な精度を達成しました。この数値は、その特定のタスクで比較されたすべての競合モデルを上回っており、正確なコマンド解釈における卓越した適応能力を証明しています。オープンソースの実装や詳細については、GitHub - cactus-compute/needle: 14MB foundation model for tiny devices; phones, wearables, smart home, and robots.をご覧ください。
効率性の向上も同様に印象的です。Needle 2は、より大規模なモデルと比較して、トークンあたりのFloating Point Operations (FLOPs)が劇的に少なくなっています。LFM2.5 230Mのようなモデルがトークンあたり約460 MFLOPsを必要とするのに対し、Needle 2はわずか70 MFLOPsで動作します。これは計算コストを7倍から85倍削減することを意味し、そのニッチな分野において競争力のある、あるいはそれ以上の結果をもたらします。
この効率性により、洗練されたAIを10ドルのチップ上で実行することが可能になり、より大規模でリソースを大量に消費するモデルでは動作不可能な、電力制限のあるエッジデバイスでも高度なエージェント機能を利用できるようになります。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
理論から光の点滅へ
ベアメタルのESP32-S3マイクロコントローラーでNeedle 2が動作する様子を見ると、その実用的な能力が明らかになります。ユーザーが「7秒間紫色のライトを光らせて」といったコマンドを入力すると、モデルはそれを正確なツール呼び出しに変換し、組み込みの信頼度スコアとともに物理的なアクションをトリガーします。この推論と実行には、GPUを搭載していない小さなチップ上で約40秒かかりますが、その機能自体は革新的なものです。
このパフォーマンスは、より高性能なハードウェア上では劇的に向上します。Needle 2はRaspberry Pi 5上で最大500 tokens/secondを達成し、ロボティクスやインタラクティブデバイスなどのリアルタイムアプリケーションに非常に適しています。VRデバイスでは400〜1,500 tokens/second、低価格スマートフォンでは300〜700 tokens/secondに達し、さまざまなエッジプラットフォームへの適応性を示しています。
Needle 2は、新しいクラスのインテリジェントで低コストな製品への道を切り開きます。agentic tool call dispatcherとして完全にオフラインで動作するその能力は、以下のような分野に恩恵をもたらします。
- IoTデバイス
- Pebble Index 01リングなどのウェアラブルデバイス
- スマートホームシステム
これにより、クラウドに依存することなく、私たちが日常的に使用するデバイス内で直接、プライバシーに配慮した高度なAIを実現できます。
よくある質問
Needle 2とは何ですか?
Needle 2は、Cactus Computeによって作成された4500万パラメータ、14MBのエージェント型LLMです。ツール呼び出しや関数ディスパッチタスクのために、マイクロコントローラーのような低電力エッジデバイスで実行されるよう特別に設計されています。
Needle 2は汎用チャットボットとして機能しますか?
いいえ。Needle 2は一般的な知識や会話に基づいてトレーニングされていません。自然言語コマンドを解釈し、定義済みのデバイス機能を実行することに特化しているため、チャットボットではなくツール呼び出しディスパッチャーです。
Needle 2がこれほど小型で効率的な理由は何ですか?
その効率性は、重みの代わりにハッシュ化されたn-gramルックアップテーブルを使用する新しいアーキテクチャ、学習可能なパラメータをほとんど必要としないHadamard transform MLP、そしてトレーニング開始時から適用される特殊な2ビット量子化によるものです。
Needle 2はどのようなハードウェアで実行できますか?
ESP32-S3マイクロコントローラー、Raspberry Pi 5、Meta QuestのようなVRヘッドセット、低価格スマートフォンなど、GPUやNPUを搭載していない非常に制約のあるハードウェアでも実行可能です。

