Skip to content
AIツール

Needle 2 レビュー

Needle 2は、ツール呼び出し、デバイス使用、および小型でリソースに制約のあるデバイスでの構造化抽出のために設計された、オープンな4500万パラメーター、14MBのエージェント型LLMです。

shipped 2026年8月18日freemium
Domain rating51Monthly visits269/mo
Needle 2 — product screenshot

注目ポイント

1オープンな4500万パラメーターモデル、重さ14MB。
2オンデバイス実行に最適化されており、フルセッションで約28MBのRAMを必要とします。
3Raspberry Pi 5で500トークン/秒、200ドル以下のスマートフォンで300~700トークン/秒のデコードを実現します。
4効率のためにCQ2ビット量子化とSimple Attention Networkアーキテクチャを利用しています。

Needle 2 について

ビジネスモデル
Hybrid (Subscription + Usage)
資金調達
Y Combinator
対象ユーザー
Developers and companies building AI applications on edge devices

仕様

APIドキュメント

API提供状況

はい、公開API

overview

Needle 2とは?

Needle 2は、Cactus Computeが開発したコンパクトなエージェント型大規模言語モデル(LLM)ツールで、制約のあるハードウェア上でファームウェアやアプリを出荷するチームが、ツール呼び出し、デバイス使用、構造化抽出を実行できるようにします。これは、リソースに制約のある環境での効率的なオンデバイス実行のために特別に設計された、オープンな4500万パラメーターモデルで、重さは14MBです。

features

Needle 2の主な機能

Needle 2は、エッジAI展開のために設計されたいくつかの技術革新と機能を組み込んでおり、効率性と特殊なタスクに焦点を当てています。

  • Hugging Faceでウェイトが利用可能なオープンな4500万パラメーターモデル。
  • コンパクトな14MBのモデルサイズで、約28MBのRAMで動作します。
  • 事前学習から適用されるCactus Quantsを使用したCQ2ビット量子化。
  • Hadamard MLPとGQAアテンションを備えたSimple Attention Networkアーキテクチャ。
  • ツール呼び出しと多段階タスク実行のためのエージェント型LLM機能。
  • スキーマ準拠のためのバイトレベル文法コンパイラによる構造化抽出。
  • オフライン操作とプライバシー強化のためのオンデバイスAI展開。
  • ハイブリッドAIアーキテクチャのためのクラウドフォールバック機能。
  • 外部支援を要求できる後学習済みモデル。
  • 高い推論速度:Raspberry Pi 5で500トークン/秒、VRデバイスで400~1,500トークン/秒。

use cases

Needle 2を使用すべきユーザー

Needle 2は、リソースに制約のあるハードウェアをターゲットとする開発者や企業向けに特別に設計されており、より大きなモデルが実用的でない場合にローカルAI機能を提供します。

  • 制約のあるハードウェア上でファームウェアやアプリを出荷するチーム:200ドル以下のデバイス(例:低価格スマートフォン、マイクロコントローラー(ESP32-S3など))にAIを統合するため。
  • シードステージのウェアラブルおよびIoTスタートアップ:スクリーンレスデバイスでの音声操作やオフライン家電制御を可能にするため。
  • 中規模の家電OEMおよびロボティクスチーム:ローカルで低遅延のAIを必要とするデバイス使用、スマートホーム制御、ロボットアクションのため。
  • オフラインフォールバックを必要とする大規模デバイスメーカー:インターネット接続がない場合でもAI機能を確保するため。
  • エッジ展開に取り組む開発者:Raspberry Piなどのデバイスでのレシート/請求書フィールド抽出や列挙型タグ付けのような構造化抽出タスクのため。

how to use

Needle 2の使用方法

Needle 2は、ウェイトとソースコードが公開されているオープンモデルであり、開発者はこれをエッジAIプロジェクトに統合できます。

pricing

Needle 2の価格とプラン

Needle 2はフリーミアムビジネスモデルで運営されており、Cactus Computeからのプレミアム機能やサービスを利用できる可能性を秘めつつ、そのコア機能へのアクセスを提供します。

  • フリーミアム:モデルウェイトとソースコードは公開されており、プロジェクトでの無料使用と統合が可能です。

Pros

  • +Ultra-compact 14MB binary, 45-million-parameter model.
  • +Designed for efficient on-device and offline operation, ensuring privacy and low latency.
  • +High inference speeds on resource-constrained hardware (e.g., 500 tokens/second on Raspberry Pi 5).
  • +Open-source (MIT-licensed) with code on GitHub and weights on Hugging Face.
  • +Enables AI capabilities on inexpensive devices (under $200) lacking GPUs or NPUs.
  • +Specialized for tool calling, device control, and structured data extraction.

Cons

  • May struggle with general intelligence or complex reasoning for arbitrary tool calling compared to larger models.
  • Requires specific fine-tuning for optimal performance on highly specialized tasks.
  • Initial web demo reception indicated it might not be impressive for general-purpose tasks.
  • Deployment requires technical expertise in edge computing and firmware integration.

Storkでもっと

関連AIツール

同じカテゴリの他のツール(共通タグで関連付け)