Skip to content
KI-Werkzeug

Needle 2 Review

Needle 2 ist ein offenes agentisches LLM mit 45 Millionen Parametern und 14 MB, das für Tool Calling, Gerätenutzung und strukturierte Extraktion auf winzigen, ressourcenbeschränkten Geräten entwickelt wurde.

shipped 18. Aug. 2026freemium
Domain rating51Monthly visits269/mo
Needle 2 — product screenshot

Warum es wichtig ist

1Ein offenes Modell mit 45 Millionen Parametern und einem Gewicht von 14 MB.
2Optimiert für die Ausführung auf dem Gerät, benötigt ca. 28 MB RAM für eine vollständige Sitzung.
3Erreicht 500 Tokens/Sek. Dekodierung auf einem Raspberry Pi 5 und 300–700 Tokens/Sek. auf Telefonen unter 200 $.
4Nutzt CQ2-bit Quantisierung und eine Simple Attention Network Architektur für Effizienz.

Über Needle 2

Geschäftsmodell
Hybrid (Subscription + Usage)
Finanzierung
Y Combinator
Zielgruppe
Developers and companies building AI applications on edge devices

Spezifikationen

API-Dokumentation

API verfügbar

Ja, öffentliche API

overview

Was ist Needle 2?

Needle 2 ist ein kompaktes, agentisches Large Language Model (LLM)-Tool, das von Cactus Compute entwickelt wurde und Teams, die Firmware oder Apps auf eingeschränkter Hardware ausliefern, die Durchführung von Tool Calling, Gerätenutzung und strukturierter Extraktion ermöglicht. Es ist ein offenes Modell mit 45 Millionen Parametern und einem Gewicht von 14 MB, das speziell für die effiziente Ausführung auf Geräten in ressourcenbeschränkten Umgebungen entwickelt wurde.

features

Hauptmerkmale von Needle 2

Needle 2 integriert mehrere technische Innovationen und Fähigkeiten, die für die Edge AI-Bereitstellung entwickelt wurden, wobei der Schwerpunkt auf Effizienz und spezialisierten Aufgaben liegt.

  • Offenes Modell mit 45 Millionen Parametern, Gewichte auf Hugging Face verfügbar.
  • Kompakte Modellgröße von 14 MB, läuft in ca. 28 MB RAM.
  • CQ2-bit Quantisierung mit Cactus Quants, angewendet ab dem Pretraining.
  • Simple Attention Network Architektur mit Hadamard MLP und GQA Attention.
  • Agentische LLM-Fähigkeiten für Tool Calling und mehrstufige Aufgabenausführung.
  • Strukturierte Extraktion mit einem Byte-Level-Grammatik-Compiler für Schema-Konformität.
  • On-device AI-Bereitstellung für Offline-Betrieb und verbesserte Privatsphäre.
  • Cloud-Fallback-Funktionalität für hybride KI-Architekturen.
  • Post-trainierte Modelle, die externe Unterstützung anfordern können.
  • Hohe Inferenzgeschwindigkeiten: 500 Tokens/Sek. auf Raspberry Pi 5, 400–1.500 Tokens/Sek. auf VR-Geräten.

use cases

Wer sollte Needle 2 verwenden?

Needle 2 wurde speziell für Entwickler und Unternehmen entwickelt, die auf ressourcenbeschränkte Hardware abzielen und lokale KI-Funktionen anbieten, wo größere Modelle unpraktisch sind.

  • Teams, die Firmware oder Apps auf eingeschränkter Hardware ausliefern: Für die Integration von KI in Geräte unter 200 $, wie z.B. Budget-Telefone und Mikrocontroller (z.B. ESP32-S3).
  • Seed-Stage Wearable- und IoT-Startups: Um Voice-to-Action auf bildschirmlosen Geräten und Offline-Gerätesteuerung zu ermöglichen.
  • Mid-Market Consumer-Electronics OEMs und Robotik-Teams: Für Gerätenutzung, Smart-Home-Steuerung und Roboteraktionen, die lokale, latenzarme KI erfordern.
  • Große Gerätehersteller, die einen Offline-Fallback benötigen: Um KI-Funktionalität auch ohne Internetverbindung zu gewährleisten.
  • Entwickler, die an Edge-Bereitstellung arbeiten: Für strukturierte Extraktionsaufgaben wie die Extraktion von Beleg-/Rechnungsfeldern oder Enum-Tagging auf Geräten wie Raspberry Pis.

how to use

Wie man Needle 2 verwendet

Needle 2 ist ein offenes Modell, dessen Gewichte und Quellcode öffentlich zugänglich sind, sodass Entwickler es in ihre Edge AI-Projekte integrieren können.

  • 1Zugriff auf die Modellgewichte auf Hugging Face zur Integration in Projekte.
  • 2Klonen Sie den Quellcode von GitHub (https://github.com/cactus-compute/cactus), um die Engine und den Trainingscode zu nutzen.
  • 3Beachten Sie die API-Dokumentation (https://docs.cactuscompute.com/) für detaillierte Anweisungen zum Tool Calling und zur strukturierten Extraktion.
  • 4Stellen Sie die 14 MB große, eigenständige Binärdatei auf Zielhardware wie ESP32-S3, Raspberry Pi 5 oder Telefone unter 200 $ bereit.
  • 5Implementieren Sie Tool-Beschreibungen und Schemata, um die agentischen Fähigkeiten von Needle 2 für spezifische Geräteinteraktionen oder Datenextraktionsaufgaben zu nutzen.

pricing

Needle 2 Preise & Pläne

Needle 2 basiert auf einem Freemium-Geschäftsmodell und bietet Zugang zu seinen Kernfunktionen mit Potenzial für Premium-Funktionen oder -Dienste von Cactus Compute.

  • Freemium: Die Modellgewichte und der Quellcode sind offen verfügbar und ermöglichen die kostenlose Nutzung und Integration in Projekte.

Pros

  • +Ultra-compact 14MB binary, 45-million-parameter model.
  • +Designed for efficient on-device and offline operation, ensuring privacy and low latency.
  • +High inference speeds on resource-constrained hardware (e.g., 500 tokens/second on Raspberry Pi 5).
  • +Open-source (MIT-licensed) with code on GitHub and weights on Hugging Face.
  • +Enables AI capabilities on inexpensive devices (under $200) lacking GPUs or NPUs.
  • +Specialized for tool calling, device control, and structured data extraction.

Cons

  • May struggle with general intelligence or complex reasoning for arbitrary tool calling compared to larger models.
  • Requires specific fine-tuning for optimal performance on highly specialized tasks.
  • Initial web demo reception indicated it might not be impressive for general-purpose tasks.
  • Deployment requires technical expertise in edge computing and firmware integration.

Mehr auf Stork

Verwandte KI-Tools

Weitere Tools dieser Kategorie, über gemeinsame Tags zugeordnet