Der wahre Feind ist nicht das Modell – es ist der Arbeitsspeicher
Das Ausführen von Large Language Models (LLMs) auf Edge-Geräten stößt auf einen grundlegenden Engpass: nicht die reine Rechenleistung, sondern das ständige Hin- und Herschieben von Modellgewichten zwischen Speicher und Prozessor. Diese „Memory Wall“ bedeutet, dass das Abrufen eines Gewichts aus dem Speicher oft weitaus mehr Energie verbraucht als die eigentlichen Berechnungen, die es ermöglicht, insbesondere während des schnellen, iterativen Prozesses der Token-Generierung.
Betrachten wir den Umfang: Ein Modell wie Llama 3.1 8B benötigt etwa 16 GB für seine Gewichte im FP16-Format. Selbst mit aggressiver 4-Bit-Quantisierung erfordert dies immer noch etwa 4 GB Speicherplatz, bevor Aktivierungen und anderer Laufzeit-Overhead berücksichtigt werden. Das wiederholte Verschieben dieser Gigabytes an Daten ist die primäre Einschränkung für die Leistung und den Stromverbrauch von LLMs auf Geräten.
Forscher des MIT und der Duke University schlagen eine radikale Lösung vor: AIR-LLM. Ihr Ansatz verlagert das Problem vom Gerätespeicher auf die drahtlose Infrastruktur, indem LLM-Gewichte über die Luft übertragen werden. Anstatt Gewichte lokal auf jedem Telefon zu speichern, sendet sie ein zentraler Funksender, wie eine 5G-Basisstation.
Dieser Ansatz nutzt Orthogonal Frequency-Division Multiplexing (OFDM), dieselbe Technologie, die Wi-Fi und 5G zugrunde liegt. Jedes Modellgewicht wird einer eigenen Unterträgerfrequenz zugeordnet, wodurch das Gerät Berechnungen direkt auf dem eingehenden Funksignal durchführen kann, ohne dass eine lokale Speicherung oder ein Abruf aus dem Speicher erforderlich ist.
Ein Funksignal wird Teil des KI-Chips
Forscher schlagen eine neuartige Architektur vor, bei der ein zentraler Funksender, wie eine 5G-Basisstation, Modellgewichte mittels Orthogonal Frequency-Division Multiplexing (OFDM) überträgt. Diese Technik, die in Wi-Fi- und Mobilfunksystemen üblich ist, unterteilt ein Signal in Tausende von Unterträgern; jeder Unterträger trägt ein einzelnes Modellgewicht.
Der vorhandene RF-Mischer eines Telefons wird dann Teil des KI-Chips. Diese Komponente kombiniert das eingehende Broadcast-Signal (das die Gewichte trägt) mit den lokalen Prompt-Aktivierungen des Telefons. Entscheidend ist, dass die analoge Operation des Mischers auf natürliche Weise das Skalarprodukt (dot product) dieser beiden Signale berechnet – die grundlegende mathematische Operation in jeder LLM-Schicht – direkt innerhalb der Funkwelle.
Dieses Design vermeidet die Speicherung von Modellgewichten auf dem Gerät vollständig. Das Telefon verarbeitet weiterhin seinen Prompt und führt nachfolgende Berechnungen durch, aber die speicherintensivste Aufgabe – das Laden von Gewichten – verlagert sich auf einen Broadcast-Mechanismus. Eine Übertragung bedient alle Geräte in Reichweite und bewahrt die Privatsphäre der Nutzer, da Prompts das Telefon nie verlassen.
Simulationen mit Llama 3.1 8B in städtischen Modellen von Paris und München zeigten beeindruckende Ergebnisse. Die Genauigkeit der Vorhersage des nächsten Wortes verschlechterte sich nur um 4,0 %, während die Energie pro Token im Vergleich zum Streaming von FP16-Gewichten um das 157,7-fache sank. Diese analoge Berechnung innerhalb des Funksignals stellt einen radikalen Ansatz für Edge-KI dar.
Große Energieeinsparungen mit einem Broadcast-Vorteil
Diese neuartige Architektur verspricht erhebliche Effizienzgewinne. Forscher berichten von einer bis zu 157,7-fach geringeren Energie pro Token im Vergleich zum Streaming unkomprimierter FP16-Gewichte. Bei den gebräuchlicheren 4-Bit-quantisierten Gewichten ist die Energieeinsparung mit etwa 40,4-fach immer noch beträchtlich.
Diese Energieeinsparungen gehen mit einer minimalen Leistungseinbuße einher. Bei Tests auf dem WikiText-2-Benchmark verschlechterte sich die Perplexity der Next-Token-Vorhersage eines Llama 3.1 8B-Modells um nur etwa 4 % im Vergleich zum ursprünglichen Modell. Dies deutet darauf hin, dass die Antworten des Modells trotz des Wechsels zur analogen Berechnung weitgehend konsistent bleiben.
Die Eins-zu-viele-Broadcast-Natur dieses Systems bietet einen erheblichen Vorteil, insbesondere in Szenarien mit mehreren Benutzern. Eine einzige Übertragung kann zahlreiche Geräte gleichzeitig bedienen. Dies reduziert die Sendezeit drastisch, wobei die berichteten Zahlen eine 104,1-fache Reduzierung der Sendezeit für 20 Benutzer im Vergleich zu separaten Unicast-Streams von FP16-Gewichten und eine 26-fache Reduzierung für 4-Bit-Gewichte zeigen.
Es ist entscheidend, diese simulierten Sendezeitreduzierungen von der garantierten Leistung in der realen Welt zu unterscheiden, da die tatsächlichen Netzwerkbedingungen variieren können. Dennoch ist das Potenzial einer Basisstation, als geteilte Ressource zu fungieren – ähnlich wie ein Radio- oder Fernsehsender – überzeugend. Weitere technische Details finden Sie im Paper: AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Das Problem schwacher Signale ist nach wie vor sehr real.
Ingenieure simulierten diese Architektur unter Verwendung von NVIDIA Sionna Ray-Tracing-Modellen von Paris und München, gepaart mit im Labor profilierten RF-Mixer-Messungen. Dies bot eine robuste Bewertungsumgebung, beinhaltete jedoch keinen vollständigen Live-Mobilfunkeinsatz. Daher bleiben die beeindruckenden Energieeinsparungen eine theoretische Obergrenze, die noch einer Validierung in der realen Welt bedarf.
Die größte Hürde für diese analoge Berechnung ist die Anfälligkeit von Funksignalen gegenüber Umwelteinflüssen. Rauschen, Signalschwund, physische Hindernisse und Mehrwegeinterferenzen können die empfindlichen analogen Berechnungen, die vom RF-Mixer durchgeführt werden, korrumpieren. Im Gegensatz zu digitalen Systemen, die Fehler korrigieren können, ist die analoge Berechnung von Natur aus weniger robust gegenüber Signalverschlechterungen.
Forscher hoben einen spezifischen Fehlerfall in einem simulierten Szenario mit schlechtem Empfang in München hervor: Das Large Language Model (LLM) verfing sich in repetitivem Text und generierte Phrasen wie „it's beer gardens and its beer gardens“. Dies zeigt, wie selbst geringfügige Probleme mit der Signalintegrität zu erheblichen Inferenzfehlern führen können, was die Herausforderung unterstreicht, die Genauigkeit unter variierenden realen Bedingungen aufrechtzuerhalten.
Wenn Ingenieure diese Robustheitsherausforderungen bewältigen können, könnte Broadcast-Inferenz tiefgreifende Auswirkungen auf speicherbeschränkte Geräte wie Smartphones und Wearables haben. Die Fähigkeit, große Modelle auszuführen, ohne Gewichte lokal zu speichern, würde erheblichen Onboard-Speicher freigeben. Die Gewährleistung einer konsistenten Leistung über verschiedene geografische und Signalumgebungen hinweg sowie die Adressierung von Datenschutz und zuverlässiger Abdeckung bleiben jedoch kritische offene Herausforderungen für den praktischen Einsatz.
Häufig gestellte Fragen
Was ist AIR-LLM?
AIR-LLM ist ein Forschungsansatz, der AI-Modellgewichte über Funk überträgt und die RF-Hardware eines Geräts nutzt, um Teile der Berechnung durchzuführen.
Läuft AIR-LLM heute schon auf echten Telefonen?
Noch nicht. Die berichtete Auswertung kombiniert simulierte Stadt-Funkkanäle mit Messungen eines RF-Mixers; es handelt sich nicht um eine Live-Demonstration von Telefon zu Funkmast.
Empfängt der Funkmast meine Prompts?
Beim vorgeschlagenen Einweg-Broadcast-Design verbleiben Prompts und Aktivierungen auf dem Gerät, anstatt an den Mast gesendet zu werden.
Wie viel Energie kann AIR-LLM einsparen?
Das Paper berichtet von bis zu 157,7-mal niedrigerem Energieverbrauch pro Token im Vergleich zum Streaming unkomprimierter FP16-Gewichte, mit geringeren Einsparungen gegenüber 4-Bit-Streaming.

