Die Ente gehorcht – aber nur, wenn man bitte sagt
Eine simulierte Roboter-Ente läuft, tanzt oder reagiert nur, wenn ein 15 MB großes KI-Gehirn, Needle 3, eine natürlichsprachliche Anfrage einem von fünf verfügbaren Werkzeugen zuordnet. Diese Demonstration von Better Stack zeigt eine speziell angepasste Version des kompakten Basismodells von Cactus Compute, das eine virtuelle Open Duck Mini steuert, ein physiksimuliertes Modell.
Needle 3 ist kein Chatbot; es unterhält sich nicht und steuert nicht die Laufmechanik der Ente. Stattdessen übernimmt ein separater gelernter Controller die Bewegung der Ente, während Needle die Aktion auswählt (z. B. laufen, drehen, gestikulieren, tanzen, Kopf schütteln). Die spezifische Aufgabe des Modells besteht darin, diese Werkzeuge einzusetzen und sogar auf Nuancen zu reagieren, wie etwa die Anforderung von „bitte“ für Befehle.
Dieses fokussierte Design ermöglicht es dem Modell, unglaublich klein und effizient zu sein. Die in der Demo verwendete 4-Layer-Version ist nur 15 Megabyte groß und damit für die lokale Ausführung auf Edge-Geräten geeignet. Dieses Experiment unterstreicht die praktische Edge AI, bei der eine begrenzte Werkzeugsteuerung offline laufen kann und sofortige, geräteinterne Reaktionsfähigkeit ohne Cloud-Verbindung bietet.
Needle 3 von Cactus Compute, Teil ihrer Familie von Tool-Calling-Modellen, reicht von 8 MB bis 29 MB. Die „Intelligenzleiter“-Architektur ermöglicht es Entwicklern, einen Ausschnitt des 121-Millionen-Parameter-Modells (mit einer Rechenleistung, die 50 Millionen Parametern entspricht) auszuwählen, um es an verschiedene Hardware anzupassen, von Smartphones bis hin zu Mikrocontrollern. Dies ermöglicht lokale KI-Funktionen in Geräten wie dem Pebble Index 01 Smart Ring.
Ein Modell, zugeschnitten auf das Gerät
Needle 3 führt eine „Intelligenzleiter“ ein, ein 20-Layer-Modell, das für einen flexiblen Einsatz konzipiert ist. Entwickler können jeden Präfix-Ausschnitt von 2 bis 20 Layern verwenden, und jeder fungiert als eigenständiges Modell. Dies ermöglicht es, dass ein einziger Modell-Download verschiedene Hardware bedienen kann, von winzigen Mikrocontrollern bis hin zu leistungsfähigeren Smartphones.
Das vollständige Needle 3 verfügt über 121 Millionen Parameter, ein deutlicher Sprung gegenüber den 45 Millionen von Needle 2. Mehr als die Hälfte dieser Parameter befinden sich jedoch in einer N-Gram-Lookup-Tabelle. Diese Designentscheidung minimiert arithmetische Operationen und hält das tatsächliche Rechenprofil laut Cactus Compute näher an einem Modell mit 50 Millionen Parametern.
Diese Architektur schafft einen direkten Kompromiss: Größere Ausschnitte bieten erweiterte Funktionen, während kleinere für Geräte mit engen Hardwarebeschränkungen geeignet sind. Needle ist explizit als Tool-Calling-Dispatcher konzipiert, nicht für offene Konversationen. Es zeichnet sich dadurch aus, natürlichsprachliche Befehle einer vordefinierten Menge von Aktionen zuzuordnen, Parameter in strukturiertes JSON zu extrahieren oder Text-Embeddings für die lokale Suche zu generieren.
Seine gezielte Funktion ermöglicht eine bemerkenswerte Effizienz. Cactus berichtet beispielsweise, dass eine 4-Layer-Version mit nur 29 Millionen Parametern nach einer Feinabstimmung bei bestimmten Aufgaben DeepSeek V4 Flash übertreffen kann. Diese Spezialisierung ermöglicht es Needle 3, auf ressourcenbeschränkten Geräten wie dem Pebble Index 01 Smart Ring zu laufen und Sprachbefehle offline auszuführen.
Manieren lehren mit 1.700 Beispielen
Um der Roboter-Ente Manieren beizubringen, war ein klares Regelwerk für ihre fünf verfügbaren Werkzeuge erforderlich: laufen, drehen, gestikulieren, tanzen und Kopf schütteln. Die Ente wurde darauf trainiert:
- Anfragen zu befolgen, die „bitte“ enthalten.
- Nackte Befehle durch Kopfschütteln abzulehnen.
- Wut bei Beleidigungen oder Drohungen auszudrücken, selbst wenn „bitte“ verwendet wurde.
- Auf dramatische Ereignisse zu reagieren, ohne dass „bitte“ erforderlich ist.
- Keinen Werkzeugaufruf für Aufgaben zu tätigen, die sie nicht ausführen konnte, wie etwa das Einstellen eines Timers.
Um diese Verhaltensweisen zu vermitteln, erstellte der Entwickler etwa 1.700 Trainingsbeispiele. Jedes Beispiel verknüpfte eine natürlichsprachliche Eingabeaufforderung mit der gewünschten Tool-Antwort, wodurch sichergestellt wurde, dass das Modell die zugrunde liegenden Konzepte lernte, anstatt exakte Phrasen auswendig zu lernen. Zum Beispiel wurde "tu bitte so, als hättest du Angst" einem Angst-Emote zugeordnet, während "Ich muss dich daran erinnern, Milch zu kaufen" zu keinem Aufruf führte, da diese Funktion nicht existiert.
Ein separates Set von 49 handgeschriebenen Prompts wurde zurückgehalten, um die Generalisierung des Modells zu testen und sicherzustellen, dass es seine erlernten "Manieren" auf neue Situationen anwenden kann. Weitere Informationen zur zugrunde liegenden Technologie finden Sie unter Needle 3 - Foundation Model for Tiny Devices - Cactus Compute.
Der Fine-Tuning-Prozess fand auf einer RTX 5090 Workstation statt. Das Training des vollständigen 20-Layer Needle 3 Modells dauerte etwa 12,5 Minuten, während eine kleinere 4-Layer-Version (etwa 15 Megabyte) in etwa 5 Minuten fertiggestellt wurde. Ein wesentlicher Nachteil dieses lokalen Fine-Tunings war der Verlust des Konfidenzwerts des Modells, eine Funktion, die normalerweise bei der gehosteten Plattform von Cactus Compute verfügbar ist.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Das kleine Modell gewinnt – mit knappem Vorsprung
Die Ergebnisse der zurückgehaltenen Daten zeigten deutlich den Nutzen des Fine-Tunings. Das untrainierte Needle 3 Basismodell erzielte lediglich 13 von 49 Punkten bei den Test-Prompts. Das feinabgestimmte, vollständige 20-Layer-Modell erreichte 41 von 49, eine signifikante Verbesserung.
Die etwa 15 MB große Vier-Layer-Version erzielte 30 von 49 Punkten, eine respektable Leistung für ihre Größe, aber dennoch deutlich niedriger als das vollständige Modell. Dieses kleinere Modell interpretierte manchmal einen unabhängigen Prompt falsch, reagierte seltsam oder erkannte die Wut der Ente bei Beleidigungen nicht. Die Leistung hängt stark von der spezifischen Aufgabe und der Qualität der Trainingsbeispiele ab.
Diese Fehler dämpfen die Begeisterung: Obwohl beeindruckend, sind die Fähigkeiten des kleinen Modells nicht universell. Sein Erfolg mit den Manieren der Ente unterstreicht sein spezialisiertes Design als Tool-Calling-Dispatcher und nicht als allgemeine Reasoning-Engine.
Die eigentliche Erkenntnis für Edge AI ist das Potenzial für spezialisierte, lokal ausgeführte Dispatcher. Sie können spezifische, begrenzte Aufgaben effizient auf kleinen Geräten bewältigen. Benchmark-Behauptungen und beeindruckende Demos sollten jedoch nicht mit allgemeiner Schlussfolgerungsfähigkeit oder garantierter Produktleistung verwechselt werden.
Häufig gestellte Fragen
Was ist Needle 3?
Needle 3 ist ein kompaktes Modell von Cactus Compute, das darauf ausgelegt ist, strukturierte Tool-Aufrufe auf ressourcenbeschränkten Geräten zu verarbeiten, anstatt als allgemeiner Chatbot zu fungieren.
Wie kann Needle 3 in ein 15 MB Modell passen?
Sein 20-Layer-Modell kann in kleinere, eigenständige Versionen unterteilt werden. Die Enten-Demo verwendete eine feinabgestimmte Vier-Layer-Version von etwa 15 MB.
Was hat das Fine-Tuning der Roboter-Ente beigebracht?
Es brachte der Ente bei, auf höfliche Anfragen zu reagieren, bloße Befehle abzulehnen, auf Unhöflichkeit oder dramatische Situationen zu reagieren und Anfragen zu ignorieren, die ihre Fähigkeiten übersteigen.
Wie gut hat das feinabgestimmte Enten-Modell abgeschnitten?
Bei 49 handgeschriebenen Test-Prompts erzielte das Vier-Layer-Modell 30 richtige Antworten, gegenüber 13 beim untrainierten Modell und 41 bei der feinabgestimmten 20-Layer-Version.

