Skip to content
research

Este chip de US$ 10 agora é um cérebro de IA

Um modelo de IA de 45 milhões de parâmetros agora cabe em um microcontrolador de US$ 10, mas seu verdadeiro poder não é a conversação. É um avanço que pode incorporar ações inteligentes em bilhões de dispositivos do dia a dia.

Aki Tanaka
Este chip de US$ 10 agora é um cérebro de IA

IA que dá ordens, não respostas

A Cactus Compute revelou o Needle 2, um inovador modelo de IA de 45 milhões de parâmetros. Este modelo compacto de 14 MB opera totalmente offline em um microcontrolador ESP32-S3 de US$ 10, expandindo os limites do que é possível para inteligência no dispositivo sem dependência da nuvem. Com código aberto sob a licença Apache 2.0, o Needle 2 demonstra um novo paradigma para IA de borda altamente restrita.

Crucialmente, o Needle 2 funciona como um dispatcher de chamadas de ferramentas especializado. Ao contrário de chatbots de uso geral, ele interpreta comandos em linguagem natural para executar funções predefinidas do dispositivo. Por exemplo, você pode dizer a um dispositivo inteligente para "piscar uma luz vermelha por três segundos", e o Needle 2 traduz isso na sequência precisa de ações necessárias para controlar um LED, girar um servo ou gerenciar operações complexas de dispositivos móveis ou casas inteligentes.

Essa eficiência notável decorre de uma troca deliberada e crítica. A Cactus Compute sacrificou o conhecimento geral amplo e a capacidade de conversação; o Needle 2 não consegue responder a perguntas factuais como "Qual é a capital da França?". Em vez disso, todos os seus dados de treinamento concentram-se exclusivamente em permitir ações no dispositivo. Isso torna o Needle 2 um especialista em ação direta e controle, não em recuperação de informações, permitindo sua pequena pegada e alta eficiência para inteligência dedicada de dispositivos.

Como a Cactus hackeou a arquitetura de LLM

A Cactus Compute projetou o Needle 2 com escolhas arquitetônicas inovadoras para alcançar seu tamanho compacto e eficiência. Uma inovação primária envolve substituir pesos aprendíveis tradicionais, que normalmente exigem extensas multiplicações de matrizes para cada token, por tabelas de consulta de n-gramas com hash. Esse design permite que o modelo recupere conhecimento diretamente da memória, em vez de executar cálculos computacionalmente caros, reduzindo drasticamente as operações de ponto flutuante (FLOPs) para apenas 70 MFLOPs/token, em comparação com 460 MFLOPs para modelos maiores.

Otimizando ainda mais a rede, a Cactus trocou as camadas padrão de MLP (Multi-Layer Perceptron) por uma transformada de Hadamard. As camadas MLP tradicionais realizam a mistura da rede usando matrizes enormes e aprendíveis, consumindo uma grande parte do orçamento de parâmetros de um modelo para aprender essas conexões. A transformada de Hadamard, uma operação matemática fixa, fornece essa mistura essencial "de graça", exigindo quase nenhum parâmetro aprendível e, assim, economizando milhões de parâmetros.

A peça final do quebra-cabeça de eficiência do Needle 2 é sua quantização de 2 bits nativa de treinamento, aproveitando os Cactus Quants proprietários. Muitos modelos pequenos sofrem degradação de desempenho significativa quando quantizados pós-treinamento, pois não foram projetados para uma compressão tão agressiva. O Needle 2, no entanto, foi explicitamente treinado contra sua própria compressão de 2 bits desde o início, garantindo desempenho ideal e eliminando a perda de qualidade nesta precisão ultrabaixa. Isso significa que o modelo de 2 bits implantado é idêntico ao que foi treinado.

Superando gigantes cinco vezes maiores

O Needle 2 desafia a noção de que modelos maiores significam inerentemente desempenho superior. O modelo de 45 milhões de parâmetros da Cactus Compute, rodando em precisão de 2 bits, compete diretamente com modelos como o LFM2.5 230M — cinco a sete vezes maior — superando-os até mesmo em testes específicos e mais difíceis de tool-calling. Esse desempenho é particularmente impressionante, dado que o LFM2.5 opera em precisão de 16 bits.

Considere seu domínio especializado: no Mobile Actions benchmark, o Needle 2 alcançou uma precisão notável de 98,3% na escolha do nome de função correto. Este número supera todos os modelos concorrentes com os quais foi comparado nessa tarefa específica, demonstrando sua aptidão excepcional para a interpretação precisa de comandos. Para aqueles interessados em sua implementação de código aberto e mais detalhes, o projeto está disponível em GitHub - cactus-compute/needle: 14MB foundation model for tiny devices; phones, wearables, smart home, and robots..

Os ganhos de eficiência são igualmente impressionantes. O Needle 2 usa drasticamente menos Floating Point Operations (FLOPs) por token do que seus equivalentes maiores. Enquanto modelos como o LFM2.5 230M requerem cerca de 460 MFLOPs/token, o Needle 2 opera com apenas 70 MFLOPs/token. Isso representa uma redução de 7x a 85x no custo computacional, entregando resultados competitivos ou até superiores em seu nicho.

Essa eficiência permite que uma IA sofisticada seja executada em um chip de US$ 10, tornando capacidades agentic avançadas acessíveis para dispositivos de borda com restrição de energia, onde modelos maiores e que consomem mais recursos simplesmente não conseguem operar.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

Da Teoria a uma Luz Piscante

Testemunhar o Needle 2 em ação em um microcontrolador ESP32-S3 puro revela sua proeza prática. Os usuários emitem comandos como "acenda uma luz roxa por sete segundos", e o modelo traduz isso em chamadas de ferramenta precisas, acionando ações físicas com uma pontuação de confiança integrada. Embora esse raciocínio e execução levem aproximadamente 40 segundos no pequeno chip sem GPU, a capacidade em si é transformadora.

Esse desempenho escala dramaticamente em hardware mais capaz. O Needle 2 alcança até 500 tokens/segundo em um Raspberry Pi 5, tornando-o altamente viável para aplicações em tempo real, como robótica e dispositivos interativos. Em dispositivos de RV, ele pode atingir de 400 a 1.500 tokens/segundo, e em smartphones de baixo custo, de 300 a 700 tokens/segundo, demonstrando sua adaptabilidade em várias plataformas de borda.

O Needle 2 agora abre caminho para uma nova classe de produtos inteligentes e de baixo custo. Sua capacidade de operar completamente offline como um agentic tool call dispatcher beneficia:

  • Dispositivos IoT
  • Wearables, como o anel Pebble Index 01
  • Sistemas de casa inteligente

Isso permite uma IA sofisticada e que preserva a privacidade diretamente nos dispositivos que usamos diariamente, sem dependência da nuvem.

Perguntas Frequentes

O que é o Needle 2?

O Needle 2 é um LLM agentic de 45 milhões de parâmetros e 14 MB criado pela Cactus Compute. Ele foi projetado especificamente para rodar em dispositivos de borda de baixo consumo, como microcontroladores, para tarefas de chamada de ferramentas e despacho de funções.

O Needle 2 pode funcionar como um chatbot de propósito geral?

Não. O Needle 2 não foi treinado em conhecimento geral ou conversação. Ele é altamente especializado em interpretar comandos de linguagem natural e executar funções de dispositivo predefinidas, tornando-o um despachante de chamadas de ferramenta, não um chatbot.

O que torna o Needle 2 tão pequeno e eficiente?

Sua eficiência vem de uma arquitetura inovadora que usa tabelas de busca de n-gramas com hash em vez de pesos, um MLP de transformada de Hadamard que quase não requer parâmetros treináveis, e uma quantização especializada de 2 bits aplicada desde o início do treinamento.

Que tipo de hardware pode rodar o Needle 2?

Ele pode rodar em hardware altamente restrito sem GPU ou NPU, incluindo o microcontrolador ESP32-S3, Raspberry Pi 5, headsets de RV como o Meta Quest e smartphones de baixo custo.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only