アヒルは従う—ただし「お願いします」と言った場合のみ
シミュレーション上のロボットのアヒルが歩いたり、踊ったり、反応したりするのは、15MBのAI脳である Needle 3 が、自然言語によるリクエストを5つの利用可能なツールのいずれかにマッピングするからです。Better Stackによるこのデモンストレーションでは、Cactus Computeのコンパクトな基盤モデルをカスタムチューニングし、物理演算モデルであるバーチャルなOpen Duck Miniを操作する様子が紹介されています。
Needle 3はチャットボットではありません。会話を行ったり、アヒルの歩行メカニズムを制御したりするわけではありません。アヒルの動きは別の学習済みコントローラーが担当し、Needleはアクション(歩く、回転する、感情表現、踊る、首を振るなど)を選択する役割を担います。このモデルの特定のタスクは、これらのツールを適切に割り当てることであり、「お願いします」という言葉を要求するようなニュアンスにも対応します。
この特化型の設計により、モデルは非常に小型で効率的になっています。デモで使用された4層バージョンはわずか15MBであり、エッジデバイスでのローカル実行に適しています。この実験は、限定的なツール割り当てをオフラインで実行し、クラウド接続なしで即座にデバイス側で応答できる、実用的な エッジAI の可能性を浮き彫りにしています。
Cactus ComputeのNeedle 3は、同社のツール呼び出しモデルファミリーの一部であり、8MBから29MBのサイズで展開されています。その「インテリジェンス・ラダー(知能の梯子)」アーキテクチャにより、開発者は1億2100万パラメータのモデル(計算量は5000万パラメータ相当)から、スマートフォンからマイクロコントローラーまで、多様なハードウェアに合わせてスライスを選択できます。これにより、Pebble Index 01 Smart RingのようなデバイスでローカルAI機能を実現しています。
デバイスに合わせてスライス可能な単一モデル
Needle 3は、柔軟なデプロイメントを目的とした20層モデル「インテリジェンス・ラダー」を導入しました。開発者は2層から20層までの任意のプレフィックススライスを取り出すことができ、それぞれが独立したモデルとして機能します。これにより、1つのモデルをダウンロードするだけで、小型のマイクロコントローラーから高性能なスマートフォンまで、多様なハードウェアに対応可能です。
フルスペックのNeedle 3は1億2100万パラメータを備えており、Needle 2 の4500万パラメータから大幅に増加しました。しかし、これらのパラメータの半分以上はn-gramルックアップテーブルに格納されています。Cactus Computeによると、この設計選択により算術演算が最小限に抑えられ、実質的な計算負荷は5000万パラメータのモデルに近いレベルに保たれています。
このアーキテクチャは直接的なトレードオフを生み出します。大きなスライスは機能が強化されますが、小さなスライスはハードウェア制約の厳しいデバイスに適しています。Needleは、自由な会話のためではなく、ツール呼び出しディスパッチャーとして明示的に設計されています。自然言語のコマンドを定義済みのツールセットにマッピングしたり、パラメータを構造化されたJSONに抽出したり、ローカル検索用のテキスト埋め込みを生成したりすることに長けています。
そのターゲットを絞った機能により、驚異的な効率性を実現しています。例えば、Cactusの報告によると、わずか2900万パラメータの4層バージョンでも、ファインチューニング後には特定のタスクにおいて DeepSeek V4 Flash を上回る性能を発揮できるとのことです。この専門性により、Needle 3はPebble Index 01 Smart Ringのようなリソース制約のあるデバイスで動作し、オフラインで音声コマンドを実行することが可能です。
1,700の例でマナーを教える
ロボットのアヒルにマナーを教えるには、5つの利用可能なツール(歩く、回転する、感情表現、踊る、首を振る)に対して明確なルールを設定する必要がありました。アヒルは以下のように学習しました。
- 「お願いします」が含まれるリクエストには従う。
- 命令口調のコマンドは首を振って拒否する。
- 侮辱や脅迫に対しては、「お願いします」が使われていても怒りを表現する。
- ドラマチックな出来事には「お願いします」なしで反応する。
- タイマーの設定など、実行できないタスクにはツールを呼び出さない。
これらの動作を定着させるため、作成者は約1,700件のトレーニング例を生成しました。各例は自然言語のプロンプトと目的のツール応答をペアにしており、モデルが正確なフレーズを暗記するのではなく、基礎となる概念を学習するようにしました。例えば、「怖がっているふりをして」という指示は怖がっているエモートにマッピングされ、「牛乳を買うのを思い出させて」という指示は、その機能が存在しないため呼び出しなしという結果になりました。
モデルの汎化性能をテストし、学習した「マナー」を新しい状況に適用できるかを確認するために、49件の手書きプロンプトを別途保持しました。基礎技術の詳細については、Needle 3 - Foundation Model for Tiny Devices - Cactus Compute を参照してください。
ファインチューニングのプロセスはRTX 5090ワークステーションで行われました。20層のNeedle 3モデル全体のトレーニングには約12.5分かかり、より小型の4層バージョン(約15メガバイト)は約5分で完了しました。このローカルでのファインチューニングにおける重要な注意点は、Cactus Computeのホスト型プラットフォームでは通常利用可能な機能である、モデルの信頼度スコアが失われることです。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
小型モデルの勝利—ただし僅差で
保持されたテスト結果は、ファインチューニングの利点を明確に示しました。調整されていないベースラインのNeedle 3は、テストプロンプト49件中わずか13件の正解でした。ファインチューニングされた20層のフルモデルは49件中41件を達成し、大幅な改善が見られました。
約15MBの4層バージョンは49件中30件を正解しました。サイズを考慮すれば立派なパフォーマンスですが、フルモデルよりはかなり低い結果です。この小型モデルは、無関係なプロンプトを誤読して奇妙な反応を示したり、侮辱に対するアヒルの怒りを識別できなかったりすることがありました。パフォーマンスは、特定のタスクとトレーニング例の質に大きく依存します。
これらの失敗は物語に冷静な視点を与えます。小型モデルの能力は印象的ですが、万能ではありません。アヒルのマナーに関する成功は、汎用的な推論エンジンではなく、ツール呼び出しディスパッチャーとしての専門的な設計を強調しています。
エッジAIにとっての真の教訓は、専門化されたローカル実行型ディスパッチャーの可能性です。これらは小型デバイス上で特定の制約されたタスクを効率的に処理できます。しかし、ベンチマークの主張や印象的なデモを、広範な推論能力や保証された製品パフォーマンスと混同すべきではありません。
よくある質問
Needle 3とは何ですか?
Needle 3は、汎用チャットボットとしてではなく、リソースが制限されたデバイス上で構造化されたツール呼び出しをディスパッチするために設計された、Cactus Computeのコンパクトなモデルです。
Needle 3はどのようにして15MBのモデルに収まるのですか?
その20層モデルは、より小さなスタンドアロンバージョンに分割可能です。アヒルのデモでは、約15MBのファインチューニングされた4層バージョンが使用されました。
ファインチューニングによってロボットアヒルは何を学びましたか?
丁寧な依頼に応答すること、単なる命令を拒否すること、無礼や劇的な状況に反応すること、そして自身の能力を超えた要求を無視することをアヒルに教えました。
ファインチューニングされたアヒルモデルのパフォーマンスはどうでしたか?
49件の手書きテストプロンプトにおいて、4層モデルは30件正解しました。これに対し、調整なしのモデルは13件、ファインチューニングされた20層モデルは41件の正解でした。

