IA que da órdenes, no respuestas
Cactus Compute ha presentado Needle 2, un innovador modelo de IA de 45 millones de parámetros. Este modelo compacto de 14 MB funciona completamente sin conexión en un microcontrolador ESP32-S3 de $10, superando los límites de lo que es posible para la inteligencia en el dispositivo sin dependencia de la nube. Con código abierto bajo la licencia Apache 2.0, Needle 2 demuestra un nuevo paradigma para la IA de borde altamente restringida.
Fundamentalmente, Needle 2 funciona como un despachador de llamadas a herramientas especializado. A diferencia de los chatbots de propósito general, interpreta comandos en lenguaje natural para ejecutar funciones predefinidas del dispositivo. Por ejemplo, puedes decirle a un dispositivo inteligente que "parpadee una luz roja durante tres segundos", y Needle 2 traduce eso en la secuencia precisa de acciones necesarias para controlar un LED, rotar un servomotor o gestionar operaciones complejas de dispositivos móviles o del hogar inteligente.
Esta notable eficiencia proviene de una compensación deliberada y crítica. Cactus Compute sacrificó el conocimiento general amplio y la capacidad de conversación; Needle 2 no puede responder preguntas factuales como "¿Cuál es la capital de Francia?". En cambio, todos sus datos de entrenamiento se centran exclusivamente en habilitar acciones del dispositivo. Esto convierte a Needle 2 en un experto en acción y control directos, no en recuperación de información, lo que permite su tamaño diminuto y alta eficiencia para la inteligencia dedicada del dispositivo.
Cómo Cactus hackeó la arquitectura de LLM
Cactus Compute diseñó Needle 2 con opciones arquitectónicas novedosas para lograr su tamaño compacto y eficiencia. Una innovación principal implica reemplazar los pesos aprendibles tradicionales, que normalmente exigen extensas multiplicaciones de matrices para cada token, con tablas de búsqueda de n-gramas hash. Este diseño permite que el modelo recupere conocimiento directamente de la memoria, en lugar de ejecutar cálculos computacionalmente costosos, reduciendo drásticamente las operaciones de punto flotante (FLOPs) a solo 70 MFLOPs/token en comparación con los 460 MFLOPs de modelos más grandes.
Optimizando aún más la red, Cactus cambió las capas estándar MLP (Perceptrón Multicapa) por una transformada de Hadamard. Las capas MLP tradicionales realizan mezclas de red utilizando enormes matrices aprendibles, consumiendo una gran parte del presupuesto de parámetros de un modelo para aprender estas conexiones. La transformada de Hadamard, una operación matemática fija, proporciona esta mezcla esencial "gratis", requiriendo casi ningún parámetro aprendible y ahorrando así millones de parámetros.
La pieza final del rompecabezas de eficiencia de Needle 2 es su cuantización de 2 bits nativa de entrenamiento, aprovechando los Cactus Quants patentados. Muchos modelos pequeños sufren una degradación significativa del rendimiento cuando se cuantizan después del entrenamiento, ya que no fueron diseñados para una compresión tan agresiva. Needle 2, sin embargo, fue explícitamente entrenado contra su propia compresión de 2 bits desde el inicio, asegurando un rendimiento óptimo y eliminando la pérdida de calidad a esta precisión ultra baja. Esto significa que el modelo de 2 bits desplegado es idéntico al entrenado.
Superando a gigantes cinco veces su tamaño
Needle 2 desafía la noción de que los modelos más grandes significan inherentemente un rendimiento superior. El modelo de 45 millones de parámetros de Cactus Compute, ejecutándose a una precisión de 2 bits, compite cara a cara con modelos como LFM2.5 230M —de cinco a siete veces su tamaño—, incluso superándolos en pruebas específicas y más difíciles de llamada a herramientas. Este rendimiento es particularmente sorprendente dado que LFM2.5 opera a una precisión de 16 bits.
Considere su dominio especializado: en el Mobile Actions benchmark, Needle 2 logró una notable precisión del 98.3% al elegir el nombre de función correcto. Esta cifra supera a todos los modelos competidores con los que se comparó en esa tarea en particular, demostrando su aptitud excepcional para la interpretación precisa de comandos. Para aquellos interesados en su implementación de código abierto y más detalles, el proyecto está disponible en GitHub - cactus-compute/needle: 14MB foundation model for tiny devices; phones, wearables, smart home, and robots..
Las ganancias en eficiencia son igualmente impresionantes. Needle 2 utiliza drásticamente menos Floating Point Operations (FLOPs) por token que sus contrapartes más grandes. Mientras que modelos como LFM2.5 230M requieren alrededor de 460 MFLOPs/token, Needle 2 opera con solo 70 MFLOPs/token. Esto representa una reducción de 7x a 85x en el costo computacional, entregando resultados competitivos o incluso superiores en su nicho.
Esta eficiencia permite que una IA sofisticada se ejecute en un chip de $10, haciendo que las capacidades agénticas avanzadas sean accesibles para dispositivos de borde con limitaciones de energía donde modelos más grandes y que consumen más recursos simplemente no pueden operar.
¿Te está gustando? Recibe uno así en tu bandeja cada mañana.
un correo al día · date de baja en dos clics · sin rastreadores de terceros
De la teoría a una luz parpadeante
Ver a Needle 2 en acción en un microcontrolador ESP32-S3 básico revela su destreza práctica. Los usuarios emiten comandos como "enciende una luz púrpura durante siete segundos", y el modelo los traduce en llamadas a herramientas precisas, activando acciones físicas con una puntuación de confianza integrada. Aunque este razonamiento y ejecución toma aproximadamente 40 segundos en el pequeño chip sin GPU, la capacidad en sí misma es transformadora.
Este rendimiento escala drásticamente en hardware más capaz. Needle 2 alcanza hasta 500 tokens/segundo en una Raspberry Pi 5, lo que lo hace altamente viable para aplicaciones en tiempo real como robótica y dispositivos interactivos. En dispositivos de realidad virtual (VR), puede alcanzar de 400 a 1,500 tokens/segundo, y en teléfonos inteligentes económicos, de 300 a 700 tokens/segundo, demostrando su adaptabilidad en varias plataformas de borde.
Needle 2 ahora allana el camino para una nueva clase de productos inteligentes de bajo costo. Su capacidad para operar completamente fuera de línea como un agentic tool call dispatcher beneficia a:
- Dispositivos IoT
- Dispositivos vestibles (wearables), como el anillo Pebble Index 01
- Sistemas de hogar inteligente
Esto permite una IA sofisticada que preserva la privacidad directamente dentro de los dispositivos que usamos a diario, sin dependencia de la nube.
Preguntas frecuentes
¿Qué es Needle 2?
Needle 2 es un LLM agéntico de 45 millones de parámetros y 14MB creado por Cactus Compute. Está diseñado específicamente para ejecutarse en dispositivos de borde de baja potencia como microcontroladores para tareas de llamada a herramientas y despacho de funciones.
¿Puede Needle 2 funcionar como un chatbot de propósito general?
No. Needle 2 no fue entrenado en conocimiento general o conversación. Está altamente especializado para interpretar comandos de lenguaje natural y ejecutar funciones de dispositivo predefinidas, lo que lo convierte en un despachador de llamadas a herramientas, no en un chatbot.
¿Qué hace que Needle 2 sea tan pequeño y eficiente?
Su eficiencia proviene de una arquitectura novedosa que utiliza tablas de búsqueda de n-gramas con hash en lugar de pesos, un MLP de transformada de Hadamard que casi no requiere parámetros aprendibles, y una cuantización especializada de 2 bits aplicada desde el inicio del entrenamiento.
¿Qué tipo de hardware puede ejecutar Needle 2?
Puede ejecutarse en hardware altamente restringido sin GPU o NPU, incluyendo el microcontrolador ESP32-S3, Raspberry Pi 5, visores de VR como Meta Quest y teléfonos inteligentes económicos.

