Skip to content
research

Um pato robô ganhou um cérebro de IA de 15 MB

Um modelo minúsculo ensinou um pato simulado a obedecer, recusar ou ficar bravo — e fez o trabalho offline. A parte surpreendente é o quanto o comportamento pode ser remodelado com alguns minutos de ajuste fino.

Aki Tanaka
Um pato robô ganhou um cérebro de IA de 15 MB

O pato obedece — mas apenas se você disser por favor

Um pato robô simulado caminha, dança ou reage apenas quando um cérebro de IA de 15 MB, Needle 3, mapeia uma solicitação em linguagem natural para uma das cinco ferramentas disponíveis. Esta demonstração, da Better Stack, apresenta uma versão personalizada do modelo de base compacto da Cactus Compute operando um Open Duck Mini virtual, um modelo simulado por física.

O Needle 3 não é um chatbot; ele não conversa nem controla a mecânica de caminhada do pato. Em vez disso, um controlador aprendido separado lida com o movimento do pato, enquanto o Needle escolhe a ação (por exemplo, caminhar, girar, emocionar, dançar, balançar a cabeça). A tarefa específica do modelo é despachar essas ferramentas, respondendo até mesmo a nuances como exigir "por favor" para comandos.

Este design focado permite que o modelo seja incrivelmente pequeno e eficiente. A versão de 4 camadas usada na demonstração tem apenas 15 megabytes, tornando-a adequada para execução local em dispositivos de borda. Este experimento destaca a edge AI prática, onde o despacho de ferramentas limitado pode ser executado offline, oferecendo capacidade de resposta imediata no dispositivo sem conectividade com a nuvem.

O Needle 3 da Cactus Compute, parte de sua família de modelos de chamada de ferramentas, varia de 8 MB a 29 MB. Sua arquitetura de "escada de inteligência" permite que os desenvolvedores selecionem uma fatia do modelo de 121 milhões de parâmetros (com computação equivalente a 50 milhões de parâmetros) para se adequar a diversos hardwares, de telefones a microcontroladores. Isso permite recursos de IA local em dispositivos como o Pebble Index 01 Smart Ring.

Um modelo, fatiado para caber no dispositivo

O Needle 3 introduz uma "escada de inteligência", um modelo de 20 camadas projetado para implantação flexível. Os desenvolvedores podem usar qualquer fatia de prefixo, de 2 a 20 camadas, e cada uma funciona como um modelo independente. Isso permite que um único download de modelo atenda a diversos hardwares, desde pequenos microcontroladores até smartphones mais potentes.

O Needle 3 completo possui 121 milhões de parâmetros, um salto significativo em relação aos 45 milhões do Needle 2. No entanto, mais da metade desses parâmetros reside em uma tabela de consulta n-gram. Essa escolha de design minimiza as operações aritméticas, mantendo o perfil de computação prático mais próximo de um modelo de 50 milhões de parâmetros, de acordo com a Cactus Compute.

Essa arquitetura cria uma troca direta: fatias maiores oferecem recursos aprimorados, enquanto as menores atendem a dispositivos com restrições rígidas de hardware. O Needle foi projetado explicitamente como um despachante de chamada de ferramentas, não para conversas abertas. Ele se destaca no mapeamento de comandos de linguagem natural para um conjunto predefinido de ações, extraindo parâmetros para JSON estruturado ou gerando embeddings de texto para pesquisa local.

Sua função direcionada permite uma eficiência notável. Por exemplo, a Cactus relata que uma versão de 4 camadas, com apenas 29 milhões de parâmetros, pode superar o DeepSeek V4 Flash em tarefas específicas após o ajuste fino. Essa especialização permite que o Needle 3 seja executado em dispositivos com recursos limitados, como o Pebble Index 01 Smart Ring, executando comandos de voz offline.

Ensinando boas maneiras com 1.700 exemplos

Ensinar boas maneiras ao pato robô exigiu um conjunto claro de regras para suas cinco ferramentas disponíveis: caminhar, girar, emocionar, dançar e balançar a cabeça. O pato foi treinado para:

  • Obedecer a solicitações que contenham "por favor".
  • Recusar comandos diretos balançando a cabeça.
  • Expressar raiva a insultos ou ameaças, mesmo que "por favor" fosse usado.
  • Reagir a eventos dramáticos sem precisar de "por favor".
  • Não fazer nenhuma chamada de ferramenta para tarefas que não pudesse realizar, como definir um temporizador.

Para incutir esses comportamentos, o criador gerou aproximadamente 1.700 exemplos de treinamento. Cada exemplo combinou um prompt em linguagem natural com a resposta de ferramenta desejada, garantindo que o modelo aprendesse os conceitos subjacentes em vez de memorizar frases exatas. Por exemplo, "finge que está com medo, por favor" foi mapeado para um emote de medo, enquanto "preciso que você me lembre de comprar leite" não resultou em nenhuma chamada, já que essa função não existe.

Um conjunto separado de 49 prompts escritos à mão foi reservado para testar a generalização do modelo, garantindo que ele pudesse aplicar seus "modos" aprendidos a situações novas. Para mais informações sobre a tecnologia subjacente, veja Needle 3 - Foundation Model for Tiny Devices - Cactus Compute.

O processo de fine-tuning ocorreu em uma estação de trabalho RTX 5090. O treinamento do modelo completo Needle 3 de 20 camadas levou cerca de 12,5 minutos, enquanto uma versão menor de 4 camadas (aproximadamente 15 megabytes) foi concluída em cerca de 5 minutos. Uma ressalva importante desse fine-tuning local foi a perda da pontuação de confiança do modelo, um recurso normalmente disponível na plataforma hospedada da Cactus Compute.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

O modelo minúsculo vence — por uma margem menor

Os resultados dos testes de retenção mostraram claramente o benefício do fine-tuning. O Needle 3 de base, sem ajuste, marcou apenas 13 de 49 nos prompts de teste. O modelo completo de 20 camadas com fine-tuning alcançou 41 de 49, uma melhoria significativa.

A versão de quatro camadas de aproximadamente 15MB marcou 30 de 49, um desempenho respeitável para seu tamanho, mas ainda consideravelmente menor do que o modelo completo. Este modelo menor às vezes interpretava mal um prompt não relacionado, dando uma reação estranha, ou falhava em identificar a raiva do pato diante de insultos. O desempenho depende fortemente da tarefa específica e da qualidade dos exemplos de treinamento.

Essas falhas moderam a história: embora impressionantes, as habilidades do modelo pequeno não são universais. Seu sucesso com os modos do pato destaca seu design especializado como um dispatcher de chamadas de ferramentas, não como um motor de raciocínio geral.

A verdadeira lição para edge AI é o potencial para dispatchers especializados executados localmente. Eles podem lidar com tarefas específicas e restritas de forma eficiente em pequenos dispositivos. No entanto, alegações de benchmark e demonstrações impressionantes não devem ser confundidas com capacidade de raciocínio amplo ou desempenho garantido do produto.

Perguntas Frequentes

O que é o Needle 3?

Needle 3 é um modelo compacto da Cactus Compute projetado para despachar chamadas de ferramentas estruturadas em dispositivos com recursos limitados, em vez de atuar como um chatbot geral.

Como o Needle 3 pode caber em um modelo de 15MB?

Seu modelo de 20 camadas pode ser fatiado em versões menores e independentes. A demonstração do pato usou uma versão de quatro camadas com fine-tuning de cerca de 15MB.

O que o fine-tuning ensinou ao pato robô?

Ensinou o pato a responder a pedidos educados, rejeitar comandos diretos, reagir à grosseria ou situações dramáticas e ignorar pedidos além de suas capacidades.

Qual foi o desempenho do modelo de pato com fine-tuning?

Em 49 prompts de teste escritos à mão, o modelo de quatro camadas marcou 30 acertos, contra 13 do modelo sem ajuste e 41 da versão de 20 camadas com fine-tuning.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.