Skip to content
research

Cette puce à 10 $ est désormais un cerveau IA

Un modèle d'IA de 45 millions de paramètres tient désormais sur un microcontrôleur à 10 $, mais sa véritable puissance ne réside pas dans la conversation. C'est une avancée qui pourrait intégrer une action intelligente dans des milliards d'appareils du quotidien.

Aki Tanaka
Cette puce à 10 $ est désormais un cerveau IA

Une IA qui donne des ordres, pas des réponses

Cactus Compute a dévoilé Needle 2, un modèle d'IA révolutionnaire de 45 millions de paramètres. Ce modèle compact de 14 Mo fonctionne entièrement hors ligne sur un microcontrôleur ESP32-S3 à 10 $, repoussant les limites de ce qui est possible pour l'intelligence embarquée sans dépendance au cloud. Open-source sous licence Apache 2.0, Needle 2 démontre un nouveau paradigme pour l'IA en périphérie (edge AI) hautement contrainte.

Crucialement, Needle 2 fonctionne comme un répartiteur d'appels d'outils spécialisé. Contrairement aux chatbots généralistes, il interprète les commandes en langage naturel pour exécuter des fonctions d'appareil prédéfinies. Par exemple, vous pouvez dire à un appareil intelligent de "faire clignoter une lumière rouge pendant trois secondes", et Needle 2 traduit cela en la séquence précise d'actions requise pour contrôler une LED, faire pivoter un servomoteur ou gérer des opérations complexes de domotique ou mobiles.

Cette efficacité remarquable découle d'un compromis délibéré et critique. Cactus Compute a sacrifié les connaissances générales étendues et la capacité conversationnelle ; Needle 2 ne peut pas répondre à des questions factuelles comme "Quelle est la capitale de la France ?". Au lieu de cela, toutes ses données d'entraînement se concentrent exclusivement sur l'activation des actions de l'appareil. Cela fait de Needle 2 un expert en action directe et en contrôle, et non en recherche d'informations, permettant son empreinte minuscule et sa haute efficacité pour une intelligence d'appareil dédiée.

Comment Cactus a piraté l'architecture LLM

Cactus Compute a conçu Needle 2 avec des choix architecturaux novateurs pour atteindre sa taille compacte et son efficacité. Une innovation majeure consiste à remplacer les poids apprenables traditionnels, qui normalement exigent des multiplications matricielles intensives pour chaque jeton, par des tables de recherche n-gram hachées. Cette conception permet au modèle de récupérer des connaissances directement depuis la mémoire, au lieu d'exécuter des calculs coûteux en ressources, réduisant drastiquement les opérations en virgule flottante (FLOPs) à seulement 70 MFLOPs/jeton contre 460 MFLOPs pour des modèles plus grands.

Optimisant davantage le réseau, Cactus a remplacé les couches MLP (Multi-Layer Perceptron) standard par une transformée de Hadamard. Les couches MLP traditionnelles effectuent un mélange de réseau en utilisant d'énormes matrices apprenables, consommant une grande partie du budget de paramètres d'un modèle pour apprendre ces connexions. La transformée de Hadamard, une opération mathématique fixe, fournit ce mélange essentiel "gratuitement", ne nécessitant presque aucun paramètre apprenable et économisant ainsi des millions de paramètres.

La dernière pièce du puzzle de l'efficacité de Needle 2 est sa quantification 2 bits native à l'entraînement, tirant parti des Cactus Quants propriétaires. De nombreux petits modèles subissent une dégradation significative des performances lorsqu'ils sont quantifiés après l'entraînement, car ils n'ont pas été conçus pour une compression aussi agressive. Needle 2, cependant, a été explicitement entraîné avec sa propre compression 2 bits dès le départ, garantissant des performances optimales et éliminant la perte de qualité à cette ultra-basse précision. Cela signifie que le modèle 2 bits déployé est identique à celui entraîné.

Battre des géants cinq fois plus grands

Needle 2 remet en question l'idée que des modèles plus grands signifient intrinsèquement des performances supérieures. Le modèle de 45 millions de paramètres de Cactus Compute, fonctionnant à une précision de 2 bits, rivalise avec des modèles comme LFM2.5 230M — cinq à sept fois plus grands — les battant même dans des tests spécifiques et plus difficiles d'appel d'outils. Cette performance est particulièrement frappante étant donné que LFM2.5 fonctionne à une précision de 16 bits.

Considérez son domaine spécialisé : sur le Mobile Actions benchmark, Needle 2 a atteint une précision remarquable de 98,3 % dans le choix du nom de fonction correct. Ce chiffre surpasse tous les modèles concurrents auxquels il a été comparé pour cette tâche spécifique, démontrant son aptitude exceptionnelle à l'interprétation précise des commandes. Pour ceux qui s'intéressent à son implémentation open-source et à plus de détails, le projet est disponible sur GitHub - cactus-compute/needle: 14MB foundation model for tiny devices; phones, wearables, smart home, and robots..

Les gains d'efficacité sont tout aussi impressionnants. Needle 2 utilise beaucoup moins de Floating Point Operations (FLOPs) par jeton que ses homologues plus volumineux. Alors que des modèles comme LFM2.5 230M nécessitent environ 460 MFLOPs/jeton, Needle 2 fonctionne avec seulement 70 MFLOPs/jeton. Cela représente une réduction de 7x à 85x du coût de calcul, offrant des résultats compétitifs, voire supérieurs, dans sa niche.

Cette efficacité permet à une IA sophistiquée de fonctionner sur une puce à 10 $, rendant les capacités agentiques avancées accessibles aux appareils de périphérie à faible consommation d'énergie où des modèles plus grands et plus gourmands en ressources ne peuvent tout simplement pas fonctionner.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

De la théorie à une lumière clignotante

Voir Needle 2 en action sur un microcontrôleur ESP32-S3 nu révèle ses prouesses pratiques. Les utilisateurs émettent des commandes telles que « fais briller une lumière violette pendant sept secondes », et le modèle les traduit en appels d'outils précis, déclenchant des actions physiques avec un score de confiance intégré. Bien que ce raisonnement et cette exécution prennent environ 40 secondes sur la minuscule puce sans GPU, la capacité elle-même est transformatrice.

Ces performances augmentent considérablement sur du matériel plus performant. Needle 2 atteint jusqu'à 500 jetons/seconde sur un Raspberry Pi 5, ce qui le rend très viable pour des applications en temps réel telles que la robotique et les appareils interactifs. Sur les appareils VR, il peut atteindre 400 à 1 500 jetons/seconde, et sur les smartphones économiques, 300 à 700 jetons/seconde, démontrant son adaptabilité sur diverses plateformes de périphérie.

Needle 2 ouvre désormais la voie à une nouvelle classe de produits intelligents à faible coût. Sa capacité à fonctionner complètement hors ligne en tant qu'agentic tool call dispatcher profite aux :

  • Appareils IoT
  • Objets connectés (wearables), comme la bague Pebble Index 01
  • Systèmes de maison intelligente

Cela permet une IA sophistiquée et respectueuse de la vie privée directement au sein des appareils que nous utilisons quotidiennement, sans dépendance au cloud.

Questions fréquemment posées

Qu'est-ce que Needle 2 ?

Needle 2 est un LLM agentique de 45 millions de paramètres et de 14 Mo créé par Cactus Compute. Il est spécifiquement conçu pour fonctionner sur des appareils de périphérie à faible consommation d'énergie, comme les microcontrôleurs, pour des tâches d'appel d'outils et de répartition de fonctions.

Needle 2 peut-il fonctionner comme un chatbot polyvalent ?

Non. Needle 2 n'a pas été entraîné sur des connaissances générales ou la conversation. Il est hautement spécialisé pour interpréter des commandes en langage naturel et exécuter des fonctions d'appareil prédéfinies, ce qui en fait un répartiteur d'appels d'outils, et non un chatbot.

Qu'est-ce qui rend Needle 2 si petit et efficace ?

Son efficacité provient d'une architecture novatrice utilisant des tables de recherche de n-grammes hachées au lieu de poids, un MLP à transformée de Hadamard qui ne nécessite presque aucun paramètre apprenable, et une quantification spécialisée sur 2 bits appliquée dès le début de l'entraînement.

Quel type de matériel peut faire fonctionner Needle 2 ?

Il peut fonctionner sur du matériel hautement contraint sans GPU ni NPU, notamment le microcontrôleur ESP32-S3, le Raspberry Pi 5, les casques VR comme le Meta Quest et les smartphones économiques.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only