Le canard obéit, mais seulement si vous dites s'il vous plaît
Un canard robotique simulé marche, danse ou réagit uniquement lorsqu'un cerveau IA de 15 Mo, Needle 3, associe une requête en langage naturel à l'un des cinq outils disponibles. Cette démonstration, de Better Stack, présente une version personnalisée du modèle de fondation compact de Cactus Compute pilotant un Open Duck Mini virtuel, un modèle simulé physiquement.
Needle 3 n'est pas un chatbot ; il ne converse pas et ne contrôle pas la mécanique de marche du canard. Au lieu de cela, un contrôleur appris distinct gère le mouvement du canard, tandis que Needle choisit l'action (par exemple, marcher, tourner, exprimer une émotion, danser, secouer la tête). La tâche spécifique du modèle est de répartir ces outils, en répondant même à des nuances telles que l'exigence du « s'il vous plaît » pour les commandes.
Cette conception ciblée permet au modèle d'être incroyablement petit et efficace. La version à 4 couches utilisée dans la démonstration ne fait que 15 mégaoctets, ce qui la rend adaptée à une exécution locale sur des appareils de périphérie (edge devices). Cette expérience met en évidence l'edge AI pratique, où la répartition limitée des outils peut s'exécuter hors ligne, offrant une réactivité immédiate côté appareil sans connectivité cloud.
Needle 3 de Cactus Compute, qui fait partie de leur famille de modèles d'appel d'outils, varie de 8 Mo à 29 Mo. Son architecture en « échelle d'intelligence » permet aux développeurs de sélectionner une tranche du modèle de 121 millions de paramètres (avec un calcul équivalent à 50 millions de paramètres) pour s'adapter à divers matériels, des téléphones aux microcontrôleurs. Cela permet des capacités d'IA locale dans des appareils comme la bague intelligente Pebble Index 01.
Un modèle, découpé pour s'adapter à l'appareil
Needle 3 introduit une « échelle d'intelligence », un modèle à 20 couches conçu pour un déploiement flexible. Les développeurs peuvent prendre n'importe quelle tranche de préfixe, de 2 à 20 couches, et chacune fonctionne comme un modèle autonome. Cela permet à un seul téléchargement de modèle de servir divers matériels, des minuscules microcontrôleurs aux smartphones plus puissants.
Le Needle 3 complet comporte 121 millions de paramètres, un bond significatif par rapport aux 45 millions du Needle 2. Cependant, plus de la moitié de ces paramètres résident dans une table de recherche de n-grammes. Ce choix de conception minimise les opérations arithmétiques, maintenant le profil de calcul pratique plus proche d'un modèle à 50 millions de paramètres, selon Cactus Compute.
Cette architecture crée un compromis direct : les tranches plus grandes offrent des capacités améliorées, tandis que les plus petites conviennent aux appareils ayant des contraintes matérielles strictes. Needle est explicitement conçu comme un répartiteur d'appel d'outils, et non pour une conversation ouverte. Il excelle à mapper des commandes en langage naturel vers un ensemble prédéfini d'actions, à extraire des paramètres dans un JSON structuré ou à générer des plongements de texte pour la recherche locale.
Sa fonction ciblée permet une efficacité remarquable. Par exemple, Cactus rapporte qu'une version à 4 couches, avec seulement 29 millions de paramètres, peut surpasser DeepSeek V4 Flash sur des tâches spécifiques après un réglage fin. Cette spécialisation permet à Needle 3 de fonctionner sur des appareils aux ressources limitées comme la bague intelligente Pebble Index 01, en exécutant des commandes vocales hors ligne.
Enseigner les bonnes manières avec 1 700 exemples
Enseigner les bonnes manières au canard robotique a nécessité un ensemble clair de règles pour ses cinq outils disponibles : marcher, tourner, exprimer une émotion, danser et secouer la tête. Le canard a été entraîné à :
- Obéir aux requêtes contenant « s'il vous plaît ».
- Refuser les commandes directes en secouant la tête.
- Exprimer de la colère face aux insultes ou aux menaces, même si « s'il vous plaît » était utilisé.
- Réagir aux événements dramatiques sans avoir besoin de « s'il vous plaît ».
- Ne faire aucun appel d'outil pour les tâches qu'il ne pouvait pas effectuer, comme régler une minuterie.
Pour inculquer ces comportements, le créateur a généré environ 1 700 exemples d'entraînement. Chaque exemple associait une invite en langage naturel à la réponse d'outil souhaitée, garantissant que le modèle apprenne les concepts sous-jacents plutôt que de mémoriser des phrases exactes. Par exemple, « fais semblant d'avoir peur, s'il te plaît » était associé à une émoticône de peur, tandis que « J'ai besoin que tu me rappelles d'acheter du lait » n'entraînait aucun appel, car cette fonction n'existe pas.
Un ensemble distinct de 49 invites rédigées à la main a été mis de côté pour tester la généralisation du modèle, afin de s'assurer qu'il puisse appliquer ses « manières » apprises à de nouvelles situations. Pour en savoir plus sur la technologie sous-jacente, consultez Needle 3 - Foundation Model for Tiny Devices - Cactus Compute.
Le processus de réglage fin (fine-tuning) a été effectué sur une station de travail RTX 5090. L'entraînement du modèle complet Needle 3 à 20 couches a pris environ 12,5 minutes, tandis qu'une version plus petite à 4 couches (environ 15 mégaoctets) a été complétée en environ 5 minutes. Un inconvénient majeur de ce réglage fin local était la perte du score de confiance du modèle, une fonctionnalité généralement disponible avec la plateforme hébergée de Cactus Compute.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Le modèle miniature gagne — avec une marge plus étroite
Les résultats des tests mis de côté ont clairement montré l'avantage du réglage fin. Le modèle de base Needle 3, non ajusté, a obtenu un maigre score de 13 sur 49 sur les invites de test. Le modèle complet à 20 couches, après réglage fin, a atteint 41 sur 49, une amélioration significative.
La version à quatre couches d'environ 15 Mo a obtenu un score de 30 sur 49, une performance respectable pour sa taille mais toujours considérablement inférieure à celle du modèle complet. Ce modèle plus petit a parfois mal interprété une invite sans rapport, donnant une réaction étrange, ou n'a pas réussi à identifier la colère du canard face aux insultes. La performance dépend fortement de la tâche spécifique et de la qualité des exemples d'entraînement.
Ces échecs tempèrent l'histoire : bien qu'impressionnantes, les capacités du petit modèle ne sont pas universelles. Son succès avec les manières du canard souligne sa conception spécialisée en tant que dispatcher d'appels d'outils, et non en tant que moteur de raisonnement général.
La véritable leçon pour l'edge AI est le potentiel des dispatchers spécialisés exécutés localement. Ils peuvent gérer des tâches spécifiques et contraintes efficacement sur de petits appareils. Cependant, les affirmations basées sur des benchmarks et les démos impressionnantes ne doivent pas être confondues avec une capacité de raisonnement étendue ou une performance produit garantie.
Questions fréquemment posées
Qu'est-ce que Needle 3 ?
Needle 3 est un modèle compact de Cactus Compute conçu pour dispatcher des appels d'outils structurés sur des appareils aux ressources limitées, plutôt que d'agir comme un chatbot généraliste.
Comment Needle 3 peut-il tenir dans un modèle de 15 Mo ?
Son modèle à 20 couches peut être découpé en versions autonomes plus petites. La démo du canard a utilisé une version à quatre couches ajustée d'environ 15 Mo.
Qu'est-ce que le réglage fin a appris au canard robot ?
Il a appris au canard à répondre aux demandes polies, à rejeter les commandes brutes, à réagir à la grossièreté ou aux situations dramatiques, et à ignorer les demandes dépassant ses capacités.
Quelle a été la performance du modèle de canard ajusté ?
Sur 49 invites de test rédigées à la main, le modèle à quatre couches a obtenu 30 bonnes réponses, contre 13 pour le modèle non ajusté et 41 pour la version à 20 couches ajustée.

