Skip to content
Ferramenta de IA

Revisão do Needle 2

Needle 2 é um LLM agêntico aberto de 45 milhões de parâmetros e 14MB, projetado para tool calling, uso de dispositivos e extração estruturada em dispositivos minúsculos e com recursos limitados.

shipped 18 de ago. de 2026freemium
Domain rating51Monthly visits269/mo
Needle 2 — product screenshot

Por que importa

1Um modelo aberto de 45 milhões de parâmetros, pesando 14MB.
2Otimizado para execução no dispositivo, exigindo aproximadamente 28MB de RAM para uma sessão completa.
3Atinge 500 tokens/segundo de decodificação em um Raspberry Pi 5 e 300–700 tokens/segundo em telefones abaixo de US$200.
4Utiliza quantização CQ2-bit e uma arquitetura Simple Attention Network para eficiência.

Sobre o Needle 2

Modelo de negócio
Hybrid (Subscription + Usage)
Financiamento
Y Combinator
Público-alvo
Developers and companies building AI applications on edge devices

Especificações

Documentação API

API disponível

Sim, API pública

overview

O que é Needle 2?

Needle 2 é uma ferramenta compacta de Large Language Model (LLM) agêntico desenvolvida pela Cactus Compute que permite que equipes que entregam firmware ou aplicativos em hardware restrito realizem tool calling, uso de dispositivos e extração estruturada. É um modelo aberto de 45 milhões de parâmetros, pesando 14MB, especificamente projetado para execução eficiente no dispositivo em ambientes com recursos limitados.

features

Principais Recursos do Needle 2

Needle 2 incorpora várias inovações técnicas e capacidades projetadas para implantação de IA de ponta, focando na eficiência e em tarefas especializadas.

  • Modelo aberto de 45 milhões de parâmetros com pesos disponíveis no Hugging Face.
  • Tamanho compacto do modelo de 14MB, rodando em aproximadamente 28MB de RAM.
  • Quantização CQ2-bit usando Cactus Quants, aplicada desde o pré-treinamento.
  • Arquitetura Simple Attention Network com Hadamard MLP e atenção GQA.
  • Capacidades de LLM agêntico para tool calling e execução de tarefas em várias etapas.
  • Extração estruturada com um compilador de gramática em nível de byte para aderência ao esquema.
  • Implantação de IA no dispositivo para operação offline e privacidade aprimorada.
  • Funcionalidade de fallback para a nuvem para arquiteturas de IA híbridas.
  • Modelos pós-treinados capazes de solicitar assistência externa.
  • Altas velocidades de inferência: 500 tokens/segundo no Raspberry Pi 5, 400–1.500 tokens/segundo em dispositivos VR.

use cases

Quem Deve Usar o Needle 2?

Needle 2 é especificamente projetado para desenvolvedores e empresas que visam hardware com recursos limitados, oferecendo capacidades de IA local onde modelos maiores são impraticáveis.

  • Equipes que entregam firmware ou aplicativos em hardware restrito: Para integrar IA em dispositivos que custam menos de US$200, como telefones de baixo custo e microcontroladores (por exemplo, ESP32-S3).
  • Startups de wearables e IoT em estágio inicial: Para habilitar voz para ação em dispositivos sem tela e controle de eletrodomésticos offline.
  • OEMs de eletrônicos de consumo de médio porte e equipes de Robótica: Para uso de dispositivos, controle de casa inteligente e ações de robôs que exigem IA local e de baixa latência.
  • Grandes fabricantes de dispositivos que precisam de um fallback offline: Para garantir a funcionalidade da IA mesmo sem conectividade com a internet.
  • Desenvolvedores trabalhando em implantação de ponta: Para tarefas de extração estruturada, como extração de campos de recibos/faturas ou marcação de enum em dispositivos como Raspberry Pis.

how to use

Como Usar o Needle 2

Needle 2 é um modelo aberto com seus pesos e código-fonte publicamente disponíveis, permitindo que os desenvolvedores o integrem em seus projetos de IA de ponta.

  • 1Acesse os pesos do modelo no Hugging Face para integração em projetos.
  • 2Clone o código-fonte do GitHub (https://github.com/cactus-compute/cactus) para utilizar o motor e o código de treinamento.
  • 3Consulte a documentação da API (https://docs.cactuscompute.com/) para instruções detalhadas sobre tool calling e extração estruturada.
  • 4Implante o binário autocontido de 14MB em hardware alvo, como ESP32-S3, Raspberry Pi 5 ou telefones abaixo de US$200.
  • 5Implemente descrições de ferramentas e esquemas para aproveitar as capacidades agênticas do Needle 2 para interações específicas do dispositivo ou tarefas de extração de dados.

pricing

Preços e Planos do Needle 2

Needle 2 opera em um modelo de negócios freemium, fornecendo acesso às suas capacidades principais com potencial para recursos ou serviços premium da Cactus Compute.

  • Freemium: Os pesos do modelo e o código-fonte estão abertamente disponíveis, permitindo uso e integração gratuitos em projetos.

Pros

  • +Ultra-compact 14MB binary, 45-million-parameter model.
  • +Designed for efficient on-device and offline operation, ensuring privacy and low latency.
  • +High inference speeds on resource-constrained hardware (e.g., 500 tokens/second on Raspberry Pi 5).
  • +Open-source (MIT-licensed) with code on GitHub and weights on Hugging Face.
  • +Enables AI capabilities on inexpensive devices (under $200) lacking GPUs or NPUs.
  • +Specialized for tool calling, device control, and structured data extraction.

Cons

  • May struggle with general intelligence or complex reasoning for arbitrary tool calling compared to larger models.
  • Requires specific fine-tuning for optimal performance on highly specialized tasks.
  • Initial web demo reception indicated it might not be impressive for general-purpose tasks.
  • Deployment requires technical expertise in edge computing and firmware integration.

Mais no Stork

Ferramentas IA relacionadas

Outras ferramentas desta categoria, associadas por tags em comum