Skip to content
Outil d'IA

Critique de Needle 2

Needle 2 est un LLM agentique ouvert de 45 millions de paramètres, pesant 14 Mo, conçu pour l'appel d'outils, l'utilisation d'appareils et l'extraction structurée sur de petits appareils à ressources limitées.

shipped 18 août 2026freemium
Domain rating51Monthly visits269/mo
Needle 2 — product screenshot

Pourquoi c'est important

1Un modèle ouvert de 45 millions de paramètres, pesant 14 Mo.
2Optimisé pour l'exécution sur appareil, nécessitant environ 28 Mo de RAM pour une session complète.
3Atteint 500 tokens/sec de décodage sur un Raspberry Pi 5 et 300 à 700 tokens/sec sur des téléphones de moins de 200 $.
4Utilise la quantification CQ2-bit et une architecture Simple Attention Network pour l'efficacité.

À propos de Needle 2

Modèle économique
Hybrid (Subscription + Usage)
Financement
Y Combinator
Public cible
Developers and companies building AI applications on edge devices

Spécifications

Documentation API

API disponible

Oui, API publique

overview

Qu'est-ce que Needle 2 ?

Needle 2 est un outil compact et agentique de Large Language Model (LLM) développé par Cactus Compute qui permet aux équipes livrant des firmwares ou des applications sur du matériel contraint d'effectuer des appels d'outils, d'utiliser des appareils et d'effectuer des extractions structurées. C'est un modèle ouvert de 45 millions de paramètres, pesant 14 Mo, spécifiquement conçu pour une exécution efficace sur appareil dans des environnements à ressources limitées.

features

Fonctionnalités clés de Needle 2

Needle 2 intègre plusieurs innovations techniques et capacités conçues pour le déploiement d'IA en périphérie, en se concentrant sur l'efficacité et les tâches spécialisées.

  • Modèle ouvert de 45 millions de paramètres avec poids disponibles sur Hugging Face.
  • Taille compacte du modèle de 14 Mo, fonctionnant avec environ 28 Mo de RAM.
  • Quantification CQ2-bit utilisant Cactus Quants, appliquée dès le pré-entraînement.
  • Architecture Simple Attention Network avec Hadamard MLP et GQA attention.
  • Capacités de LLM agentique pour l'appel d'outils et l'exécution de tâches multi-étapes.
  • Extraction structurée avec un compilateur de grammaire au niveau des octets pour l'adhérence au schéma.
  • Déploiement d'IA sur appareil pour un fonctionnement hors ligne et une confidentialité améliorée.
  • Fonctionnalité de repli cloud pour les architectures d'IA hybrides.
  • Modèles post-entraînés capables de demander une assistance externe.
  • Vitesses d'inférence élevées : 500 tokens/sec sur Raspberry Pi 5, 400–1 500 tokens/sec sur les appareils VR.

use cases

Qui devrait utiliser Needle 2 ?

Needle 2 est spécifiquement conçu pour les développeurs et les entreprises ciblant le matériel à ressources limitées, offrant des capacités d'IA locales là où les modèles plus grands sont impraticables.

  • Équipes livrant des firmwares ou des applications sur du matériel contraint : Pour intégrer l'IA dans des appareils coûtant moins de 200 $, tels que les téléphones économiques et les microcontrôleurs (par exemple, ESP32-S3).
  • Startups en phase de démarrage dans les wearables et l'IoT : Pour permettre la commande vocale sur les appareils sans écran et le contrôle hors ligne des appareils.
  • OEM d'électronique grand public de taille moyenne et équipes de robotique : Pour l'utilisation d'appareils, le contrôle de la maison intelligente et les actions de robots nécessitant une IA locale à faible latence.
  • Grands fabricants d'appareils ayant besoin d'un repli hors ligne : Pour garantir la fonctionnalité de l'IA même sans connectivité Internet.
  • Développeurs travaillant sur le déploiement en périphérie : Pour les tâches d'extraction structurée comme l'extraction de champs de reçus/factures ou le marquage d'énumérations sur des appareils comme les Raspberry Pis.

how to use

Comment utiliser Needle 2

Needle 2 est un modèle ouvert dont les poids et le code source sont accessibles au public, permettant aux développeurs de l'intégrer dans leurs projets d'IA en périphérie.

  • 1Accédez aux poids du modèle sur Hugging Face pour l'intégration dans les projets.
  • 2Clonez le code source depuis GitHub (https://github.com/cactus-compute/cactus) pour utiliser le moteur et le code d'entraînement.
  • 3Consultez la documentation de l'API (https://docs.cactuscompute.com/) pour des instructions détaillées sur l'appel d'outils et l'extraction structurée.
  • 4Déployez le binaire autonome de 14 Mo sur le matériel cible tel que l'ESP32-S3, le Raspberry Pi 5 ou les téléphones de moins de 200 $.
  • 5Implémentez des descriptions d'outils et des schémas pour exploiter les capacités agentiques de Needle 2 pour des interactions spécifiques avec les appareils ou des tâches d'extraction de données.

pricing

Tarification et plans de Needle 2

Needle 2 fonctionne sur un modèle économique freemium, offrant l'accès à ses capacités de base avec un potentiel de fonctionnalités ou de services premium de Cactus Compute.

  • Freemium : Les poids du modèle et le code source sont ouvertement disponibles, permettant une utilisation et une intégration gratuites dans les projets.

Pros

  • +Ultra-compact 14MB binary, 45-million-parameter model.
  • +Designed for efficient on-device and offline operation, ensuring privacy and low latency.
  • +High inference speeds on resource-constrained hardware (e.g., 500 tokens/second on Raspberry Pi 5).
  • +Open-source (MIT-licensed) with code on GitHub and weights on Hugging Face.
  • +Enables AI capabilities on inexpensive devices (under $200) lacking GPUs or NPUs.
  • +Specialized for tool calling, device control, and structured data extraction.

Cons

  • May struggle with general intelligence or complex reasoning for arbitrary tool calling compared to larger models.
  • Requires specific fine-tuning for optimal performance on highly specialized tasks.
  • Initial web demo reception indicated it might not be impressive for general-purpose tasks.
  • Deployment requires technical expertise in edge computing and firmware integration.

Plus sur Stork

Outils IA connexes

Autres outils de cette catégorie, rapprochés par tags communs