Das 20-GB-Problem: Warum das eigentlich nicht funktionieren sollte
Ein Large Language Model mit 35 Milliarden Parametern direkt auf einem iPhone auszuführen, scheint zunächst rechnerisch unmöglich. Ein Modell dieser Größenordnung von 35 Milliarden Parametern belegt als normale 4-Bit-Datei etwa 20 GB. Normalerweise muss dieser gesamte 20-GB-Datensatz für eine effiziente Verarbeitung im RAM liegen, eine Kapazität, die weit über der jedes Mobilgeräts liegt.
Doch eine bahnbrechende Methode hat diese Barriere durchbrochen. Forscher demonstrierten ein MoE-Modell mit 35 Milliarden Parametern, das auf einem iPhone läuft und einen aktiven Speicherbedarf von nur 1,4 GB aufweist. Dies stellt eine erstaunliche Reduzierung dar, die den typischen Speicherbedarf um über 90 % senkt.
Der Trick liegt darin, wie das Modell seine riesigen Datenmengen verwaltet. Anstatt die gesamten 20 GB in den RAM zu laden, werden nur wesentliche Komponenten und aktuell aktive „Experten“ bei Bedarf von der SSD des Geräts gestreamt. Dieser innovative Ansatz nutzt die spärlichen Aktivierungsmuster, die Mixture-of-Experts-Architekturen innewohnen.
Dieser Durchbruch signalisiert einen tiefgreifenden Wandel für künstliche Intelligenz. Wir bewegen uns auf leistungsstarke, private On-Device AI-Funktionen zu, die komplexe Aufgaben von der ständigen Abhängigkeit von Cloud-Servern befreien. Und dies öffnet die Tür für eine neue Generation intelligenter, lokaler Anwendungen.
Lernen Sie die Mixture-of-Experts (MoE)-Architektur kennen
Um den Speicherengpass für dieses Modell mit 35 Milliarden Parametern zu lösen, war ein grundlegender Architekturwechsel erforderlich: Mixture-of-Experts (MoE). Anstatt eines massiven, monolithischen Modells, bei dem jeder Teil für jedes Token aktiv ist, verwendet MoE ein Team aus kleineren, spezialisierten „Experten“. Ein dediziertes „Router“-Netzwerk wählt dynamisch nur eine Handvoll dieser Experten aus, die für eine bestimmte Aufgabe relevant sind.
Diese Architektur erweist sich als ideal für ressourcenbeschränkte Geräte wie ein iPhone. Normalerweise erfordert ein Modell mit 35 Milliarden Parametern als normale 4-Bit-Datei etwa 20 GB RAM. Aber mit MoE werden nur ausgewählte Experten in den aktiven Speicher geladen, während der Großteil auf langsameren Speichern wie einer SSD ruht. Dies reduziert den aktiven RAM-Bedarf drastisch auf nur 1,4 GB.
MoE dient nicht nur dazu, Modelle zu verkleinern; es ist auch der Schlüssel, um sie effizient auf Billionen von Parametern zu skalieren. Jetzt ermöglicht es, dass hochentwickelte LLMs direkt auf Edge-Geräten ausgeführt werden können.
Für das iPhone ist das Modell clever partitioniert. Entscheidende gemeinsame Komponenten – Embeddings, Attention-Mechanismen, Router und ein gemeinsamer Experte – bilden die 1,4 GB, die dauerhaft im RAM verbleiben. Währenddessen warten 40 einzelne Experten-Dateien, jede etwa 300 MB groß und insgesamt 12 GB schwer, auf der SSD. Für jedes Token, nachdem die Attention auf der GPU ausgeführt wurde, wählt der Router acht spezifische Experten aus, die die Engine dann von der SSD in den GPU-Speicher streamt und sie zusammen mit dem gemeinsamen Experten ausführt. Dies beinhaltet 320 kleine SSD-Lesezugriffe für jedes einzelne Token.
Die On-Demand Streaming Engine
Dieses Modell mit 35 Milliarden Parametern umgeht die 20-GB-Speicherbarriere durch die Segmentierung seiner Komponenten. Ein Kern von 1,4 GB an wesentlichen Elementen wird einmal in den RAM geladen, bildet das allgegenwärtige operative Rückgrat des Modells und bleibt während der gesamten Inferenz resident:
- Embeddings (Eingabe-Token-Repräsentationen)
- Attention-Mechanismen (kontextuelles Verständnis)
- Router (Expertenauswahl)
- ein gemeinsamer Experte (eine Allzweck-Basislinie)
Normalerweise liegen ganze Modelle im RAM, aber diese Architektur mit 35 Milliarden Parametern geht neue Wege. Stattdessen befinden sich die restlichen 12 GB an spezialisierten Experten auf der schnellen SSD des iPhones. Diese Architektur ermöglicht Streaming Experts: Das System ruft diese großen, inaktiven Teile nur dann ab, wenn der Router des Modells sie gezielt anfordert, und lädt sie bei Bedarf in den GPU-Speicher.
Für jedes einzelne Token, das das Modell generiert, findet eine rasante Abfolge von Datentransfers statt. Der Router wählt dynamisch 8 Experten innerhalb jeder der 40 Schichten aus, was 320 einzelne, kleine Lesezugriffe direkt von der SSD auslöst. Dieser konstante Hochgeschwindigkeits-Datentransfer ermöglicht es dem massiven 35B-Modell, innerhalb der engen Speicherbeschränkungen des iPhones zu arbeiten.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Die neue Grenze für Edge AI
Dieses MoE-Modell mit 35 Milliarden Parametern, das direkt auf einem iPhone läuft, eröffnet wahrlich eine neue Grenze für Edge AI. Stellen Sie sich tiefgreifend private Assistenten vor, die sensible Benutzerdaten vollständig auf dem Gerät verarbeiten, ohne Cloud-Transfer, oder Zero-Latency-Kreativwerkzeuge, die komplexe Designs oder Textantworten sofort generieren. Diese Fortschritte ermöglichen vollständig offline nutzbare KI-Anwendungen und verwandeln Fähigkeiten, die bisher auf entfernte Rechenzentren beschränkt waren, in greifbare, persönliche Realitäten.
Doch dieser Durchbruch ist nicht ohne unmittelbare Herausforderungen. Die On-Demand-Streaming-Engine erzeugt zwar genial, aber eine hohe I/O-Last, die für jedes einzelne Token 320 kleine Lesezugriffe von der SSD erfordert. Dieser intensive, konstante Datenzugriff erhöht natürlich den Batterieverbrauch und erfordert ein robustes Wärmemanagement der kompakten Gerätehardware.
Diese Hürden sind jedoch nur vorübergehend. Die Zukunft verspricht eine kraftvolle Synergie zwischen innovativen Softwaretechniken, wie der aktuellen Expert-Streaming-Engine, und zunehmend spezialisierter Hardwarebeschleunigung. Apples Neural Engine bietet beispielsweise dediziertes Silizium, das präzise für KI-Workloads entwickelt wurde. In Kombination mit kontinuierlich optimierten Frameworks und Speicherarchitekturen wird dieser integrierte Ansatz den Weg zur Mainstream-On-Device-Superintelligenz beschleunigen und leistungsstarke KI allgegenwärtig und nahtlos in unseren Alltag integrieren.
Häufig gestellte Fragen
Was ist ein Mixture-of-Experts (MoE) Modell?
Ein MoE-Modell ist eine neuronale Netzwerkarchitektur, die mehrere spezialisierte 'Experten'-Subnetzwerke verwendet. Für jede Eingabe wählt ein Routing-Mechanismus nur wenige Experten aus, um diese zu verarbeiten, was die Inferenz wesentlich effizienter macht als bei dichten Modellen, bei denen das gesamte Netzwerk genutzt wird.
Wie wurde der Speicherbedarf des 35B-Modells so drastisch reduziert?
Der belegte RAM des Modells wurde auf nur 1,4 GB reduziert, indem nur gemeinsam genutzte Komponenten im Speicher gehalten werden. Der Großteil des Modells, die 'Experten', verbleibt auf der schnellen SSD des Telefons und wird während der Inferenz bei Bedarf in den Speicher gestreamt.
Was bedeutet 'Streaming Experts'?
Es ist eine Technik, bei der Teile eines großen KI-Modells (die 'Experten' in einer MoE-Architektur) auf langsamerem SSD-Speicher gespeichert und nur dann dynamisch in schnelleren RAM oder GPU-Speicher geladen werden, wenn sie für eine bestimmte Berechnung benötigt werden, um danach wieder verworfen zu werden.
Was sind die Vorteile, große KI-Modelle auf einem Telefon auszuführen?
Die Hauptvorteile sind verbesserte Privatsphäre, da Daten das Gerät nie verlassen, geringere Latenz ohne Netzwerk-Roundtrip, volle Offline-Funktionalität und eine verringerte Abhängigkeit von kostspieliger Cloud-Infrastruktur für die Inferenz.

