Skip to content
Herramienta de IA

Reseña de Needle 2

Needle 2 es un LLM agéntico abierto de 45 millones de parámetros y 14 MB diseñado para la llamada a herramientas, el uso de dispositivos y la extracción estructurada en dispositivos pequeños y con recursos limitados.

shipped 18 ago 2026freemium
Domain rating51Monthly visits269/mo
Needle 2 — product screenshot

Por qué importa

1Un modelo abierto de 45 millones de parámetros, con un peso de 14 MB.
2Optimizado para la ejecución en el dispositivo, requiriendo aproximadamente 28 MB de RAM para una sesión completa.
3Logra 500 tokens/segundo de decodificación en una Raspberry Pi 5 y 300–700 tokens/segundo en teléfonos de menos de $200.
4Utiliza cuantificación CQ2-bit y una arquitectura Simple Attention Network para mayor eficiencia.

Sobre Needle 2

Modelo de negocio
Hybrid (Subscription + Usage)
Financiación
Y Combinator
Público objetivo
Developers and companies building AI applications on edge devices

Especificaciones

Documentación API

API disponible

Sí, API pública

overview

¿Qué es Needle 2?

Needle 2 es una herramienta compacta y agéntica de Large Language Model (LLM) desarrollada por Cactus Compute que permite a los equipos que distribuyen firmware o aplicaciones en hardware restringido realizar llamadas a herramientas, uso de dispositivos y extracción estructurada. Es un modelo abierto de 45 millones de parámetros, con un peso de 14 MB, diseñado específicamente para una ejecución eficiente en el dispositivo en entornos con recursos limitados.

features

Características Clave de Needle 2

Needle 2 incorpora varias innovaciones técnicas y capacidades diseñadas para la implementación de IA en el borde, centrándose en la eficiencia y las tareas especializadas.

  • Modelo abierto de 45 millones de parámetros con pesos disponibles en Hugging Face.
  • Tamaño de modelo compacto de 14 MB, que se ejecuta en aproximadamente 28 MB de RAM.
  • Cuantificación CQ2-bit utilizando Cactus Quants, aplicada desde el preentrenamiento.
  • Arquitectura Simple Attention Network con Hadamard MLP y atención GQA.
  • Capacidades de LLM agéntico para la llamada a herramientas y la ejecución de tareas de varios pasos.
  • Extracción estructurada con un compilador de gramática a nivel de byte para la adherencia al esquema.
  • Implementación de IA en el dispositivo para operación sin conexión y privacidad mejorada.
  • Funcionalidad de respaldo en la nube para arquitecturas de IA híbridas.
  • Modelos post-entrenados capaces de solicitar asistencia externa.
  • Altas velocidades de inferencia: 500 tokens/segundo en Raspberry Pi 5, 400–1,500 tokens/segundo en dispositivos VR.

use cases

¿Quién Debería Usar Needle 2?

Needle 2 está diseñado específicamente para desarrolladores y empresas que se dirigen a hardware con recursos limitados, ofreciendo capacidades de IA local donde los modelos más grandes son poco prácticos.

  • Equipos que distribuyen firmware o aplicaciones en hardware restringido: Para integrar IA en dispositivos que cuestan menos de $200, como teléfonos económicos y microcontroladores (por ejemplo, ESP32-S3).
  • Startups de wearables e IoT en etapa inicial: Para habilitar la voz a la acción en dispositivos sin pantalla y el control de electrodomésticos sin conexión.
  • OEMs de electrónica de consumo de mercado medio y equipos de robótica: Para el uso de dispositivos, control de hogar inteligente y acciones de robots que requieren IA local de baja latencia.
  • Grandes fabricantes de dispositivos que necesitan un respaldo sin conexión: Para garantizar la funcionalidad de la IA incluso sin conectividad a Internet.
  • Desarrolladores que trabajan en la implementación en el borde: Para tareas de extracción estructurada como la extracción de campos de recibos/facturas o el etiquetado de enumeraciones en dispositivos como Raspberry Pis.

how to use

Cómo Usar Needle 2

Needle 2 es un modelo abierto con sus pesos y código fuente disponibles públicamente, lo que permite a los desarrolladores integrarlo en sus proyectos de IA en el borde.

  • 1Acceda a los pesos del modelo en Hugging Face para su integración en proyectos.
  • 2Clone el código fuente de GitHub (https://github.com/cactus-compute/cactus) para utilizar el motor y el código de entrenamiento.
  • 3Consulte la documentación de la API (https://docs.cactuscompute.com/) para obtener instrucciones detalladas sobre la llamada a herramientas y la extracción estructurada.
  • 4Implemente el binario autocontenido de 14 MB en el hardware objetivo, como ESP32-S3, Raspberry Pi 5 o teléfonos de menos de $200.
  • 5Implemente descripciones de herramientas y esquemas para aprovechar las capacidades agénticas de Needle 2 para interacciones específicas del dispositivo o tareas de extracción de datos.

pricing

Precios y Planes de Needle 2

Needle 2 opera con un modelo de negocio freemium, proporcionando acceso a sus capacidades principales con el potencial de características o servicios premium de Cactus Compute.

  • Freemium: Los pesos del modelo y el código fuente están abiertamente disponibles, lo que permite su uso e integración gratuitos en proyectos.

Pros

  • +Ultra-compact 14MB binary, 45-million-parameter model.
  • +Designed for efficient on-device and offline operation, ensuring privacy and low latency.
  • +High inference speeds on resource-constrained hardware (e.g., 500 tokens/second on Raspberry Pi 5).
  • +Open-source (MIT-licensed) with code on GitHub and weights on Hugging Face.
  • +Enables AI capabilities on inexpensive devices (under $200) lacking GPUs or NPUs.
  • +Specialized for tool calling, device control, and structured data extraction.

Cons

  • May struggle with general intelligence or complex reasoning for arbitrary tool calling compared to larger models.
  • Requires specific fine-tuning for optimal performance on highly specialized tasks.
  • Initial web demo reception indicated it might not be impressive for general-purpose tasks.
  • Deployment requires technical expertise in edge computing and firmware integration.

Más en Stork

Herramientas IA relacionadas

Otras herramientas de esta categoría, emparejadas por etiquetas comunes