Le véritable ennemi n'est pas le modèle, c'est la mémoire
L'exécution de grands modèles de langage (LLM) sur des appareils en périphérie (edge devices) se heurte à un goulot d'étranglement fondamental : non pas l'arithmétique brute, mais le transfert constant des poids du modèle entre la mémoire et le processeur. Ce « mur de la mémoire » signifie que la récupération d'un poids depuis la mémoire consomme souvent beaucoup plus d'énergie que les calculs réels qu'elle permet, en particulier lors du processus rapide et itératif de génération de jetons (tokens).
Considérez l'échelle : un modèle comme Llama 3.1 8B nécessite environ 16 Go pour ses poids au format FP16. Même avec une quantification agressive sur 4 bits, cela exige encore environ 4 Go de stockage, sans compter les activations et autres surcharges d'exécution. Déplacer ces gigaoctets de données de manière répétée est la contrainte principale pour la performance et la consommation d'énergie des LLM sur appareil.
Des chercheurs du MIT et de l'Université Duke proposent une solution radicale : AIR-LLM. Leur prémisse déplace le problème de la mémoire de l'appareil vers l'infrastructure sans fil en diffusant les poids des LLM par voie hertzienne. Au lieu de stocker les poids localement sur chaque téléphone, une radio centrale, comme une station de base 5G, les transmet.
Cette approche exploite le multiplexage par répartition orthogonale de la fréquence (OFDM), la même technologie qui sous-tend le Wi-Fi et la 5G. Chaque poids du modèle est mappé sur une fréquence de sous-porteuse distincte, permettant à l'appareil d'effectuer des calculs directement sur le signal radio entrant, contournant ainsi le besoin de stockage local ou de récupération depuis la mémoire.
Un signal radio devient une partie de la puce IA
Les chercheurs proposent une architecture novatrice où une radio centrale, telle qu'une station de base 5G, diffuse les poids du modèle en utilisant le multiplexage par répartition orthogonale de la fréquence (OFDM). Cette technique, courante dans les systèmes Wi-Fi et cellulaires, divise un signal en milliers de sous-porteuses ; chaque sous-porteuse transporte un seul poids du modèle.
Le mélangeur RF existant d'un téléphone devient alors une partie de la puce IA. Ce composant combine le signal de diffusion entrant (transportant les poids) avec les activations de prompt locales du téléphone. De manière cruciale, l'opération analogique du mélangeur calcule naturellement le produit scalaire de ces deux signaux — l'opération mathématique fondamentale dans chaque couche de LLM — directement au sein de l'onde radio.
Cette conception évite totalement le stockage des poids du modèle sur l'appareil. Le téléphone traite toujours son prompt et gère les calculs ultérieurs, mais la tâche la plus gourmande en mémoire — le chargement des poids — est transférée vers un mécanisme de diffusion. Une seule transmission dessert tous les appareils à portée, préservant la confidentialité des utilisateurs car les prompts ne quittent jamais le téléphone.
Des simulations utilisant Llama 3.1 8B sur des modèles urbains de Paris et Munich ont montré des résultats impressionnants. La précision de la prédiction du mot suivant n'a diminué que de 4,0 %, tandis que l'énergie par jeton a été réduite de 157,7 fois par rapport au streaming de poids FP16. Ce calcul analogique au sein du signal radio représente une approche radicale de l'IA en périphérie.
D'importantes économies d'énergie, avec un avantage à l'échelle de la diffusion
Cette architecture novatrice promet des gains d'efficacité significatifs. Les chercheurs rapportent jusqu'à 157,7 fois moins d'énergie par jeton par rapport au streaming de poids FP16 non compressés. Pour des poids quantifiés sur 4 bits plus courants, la réduction d'énergie reste substantielle, à environ 40,4 fois.
Ces économies d'énergie s'accompagnent d'une dégradation minimale des performances. Lors de tests sur le benchmark WikiText-2, un modèle Llama 3.1 8B a vu la perplexité de sa prédiction du prochain jeton se dégrader d'environ 4 % seulement par rapport au modèle original. Cela suggère que les réponses du modèle restent largement cohérentes malgré le passage au calcul analogique.
La nature de diffusion un-à-plusieurs de ce système offre un avantage substantiel, en particulier dans les scénarios avec plusieurs utilisateurs. Une seule diffusion peut servir de nombreux appareils simultanément. Cela réduit considérablement le temps d'antenne, avec des chiffres rapportés montrant une réduction du temps d'antenne de 104,1 fois pour 20 utilisateurs par rapport à des flux unicast séparés de poids FP16, et de 26 fois pour des poids 4 bits.
Il est crucial de distinguer ces réductions simulées du temps d'antenne des performances réelles garanties, car les conditions réelles du réseau peuvent varier. Cependant, le potentiel d'une station de base à fonctionner comme une ressource partagée, tout comme un diffuseur radio ou TV, est convaincant. Pour plus de détails techniques, consultez l'article : AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Le problème du signal faible est toujours bien réel
Les ingénieurs ont simulé cette architecture en utilisant des modèles de lancer de rayons NVIDIA Sionna de Paris et Munich, associés à des mesures de mélangeur RF profilées en laboratoire. Cela a fourni un environnement d'évaluation robuste, mais n'a pas impliqué un déploiement cellulaire complet en direct. Par conséquent, les économies d'énergie impressionnantes restent une limite théorique supérieure, en attendant une validation dans le monde réel.
L'obstacle principal pour ce calcul analogique est la susceptibilité des signaux radio aux facteurs environnementaux. Le bruit, l'évanouissement du signal, les obstacles physiques et les interférences par trajets multiples peuvent corrompre les calculs analogiques délicats effectués par le mélangeur RF. Contrairement aux systèmes numériques qui peuvent corriger les erreurs, le calcul analogique est intrinsèquement moins robuste à la dégradation du signal.
Les chercheurs ont mis en évidence un cas d'échec spécifique dans un scénario simulé de faible réception à Munich : le large language model (LLM) est resté bloqué dans un texte répétitif, générant des phrases comme "it's beer gardens and its beer gardens". Cela démontre comment même des problèmes mineurs d'intégrité du signal peuvent conduire à des échecs d'inférence significatifs, soulignant le défi de maintenir la précision dans des conditions réelles variées.
Si les ingénieurs parviennent à surmonter ces défis de robustesse, la broadcast inference pourrait avoir un impact profond sur les appareils à mémoire limitée comme les smartphones et les objets connectés. La capacité d'exécuter de grands modèles sans stocker les poids localement libérerait une mémoire embarquée importante. Cependant, assurer des performances constantes dans divers environnements géographiques et de signal, tout en abordant la confidentialité et une couverture fiable, restent des défis ouverts critiques pour un déploiement pratique.
Foire aux questions
Qu'est-ce que AIR-LLM ?
AIR-LLM est une approche de recherche qui diffuse les poids d'un modèle d'IA par radio et utilise le matériel RF d'un appareil pour effectuer une partie du calcul.
AIR-LLM fonctionne-t-il sur de vrais téléphones aujourd'hui ?
Pas encore. L'évaluation rapportée combine des canaux radio urbains simulés avec des mesures provenant d'un mélangeur RF ; il ne s'agit pas d'une démonstration en direct téléphone-vers-antenne.
La tour cellulaire reçoit-elle vos prompts ?
Dans la conception de diffusion unidirectionnelle proposée, les prompts et les activations restent sur l'appareil plutôt que d'être envoyés à la tour.
Combien d'énergie AIR-LLM peut-il économiser ?
L'article rapporte jusqu'à 157,7 fois moins d'énergie par jeton que le streaming de poids FP16 non compressés, avec des économies plus faibles par rapport au streaming 4 bits.

