Le problème des 20 Go : pourquoi cela ne devrait pas fonctionner
Faire fonctionner un large language model de 35 milliards de paramètres directement sur un iPhone semble initialement être une impossibilité computationnelle. Un modèle de cette échelle de 35 milliards de paramètres, lorsqu'il est enregistré sous forme de fichier 4-bit standard, occupe environ 20 Go. Habituellement, l'intégralité de ce jeu de données de 20 Go doit résider dans la RAM pour un traitement efficace, une capacité bien au-delà de tout appareil mobile.
Pourtant, une méthode révolutionnaire a brisé cette barrière. Des chercheurs ont démontré un modèle MoE avec 35 milliards de paramètres fonctionnant sur un iPhone, atteignant une empreinte mémoire active de seulement 1,4 Go. Cela représente une réduction stupéfiante, diminuant les besoins en mémoire habituels de plus de 90 %.
L'astuce réside dans la manière dont le modèle gère ses vastes données. Au lieu de charger l'intégralité des 20 Go dans la RAM, seuls les composants essentiels et les « experts » actuellement actifs sont diffusés à la demande depuis le SSD de l'appareil. Cette approche innovante exploite les modèles d'activation creuse inhérents aux architectures Mixture-of-Experts.
Cette percée marque un changement profond pour l'intelligence artificielle. Nous nous dirigeons vers des capacités d'on-device AI puissantes et privées, libérant les tâches complexes de la dépendance constante aux serveurs cloud. Et cela ouvre la porte à une nouvelle génération d'applications intelligentes et localisées.
Découvrez l'architecture Mixture-of-Experts (MoE)
Résoudre le problème de mémoire pour ce modèle de 35 milliards de paramètres a nécessité un changement fondamental d'architecture : voici le Mixture-of-Experts (MoE). Au lieu d'un modèle massif et monolithique où chaque partie est active pour chaque jeton, le MoE utilise une équipe d'« experts » plus petits et spécialisés. Un réseau de « routage » dédié sélectionne dynamiquement seulement une poignée de ces experts pertinents pour une tâche donnée.
Cette architecture s'avère idéale pour les appareils aux ressources limitées comme un iPhone. Habituellement, un modèle de 35 milliards de paramètres, en tant que fichier 4-bit standard, exige environ 20 Go de RAM. Mais avec le MoE, seuls les experts sélectionnés se chargent dans la mémoire active, laissant la grande majorité en sommeil sur un stockage plus lent comme un SSD. Cela réduit considérablement l'empreinte RAM active à seulement 1,4 Go.
Le MoE ne sert pas seulement à réduire la taille des modèles ; c'est aussi la clé pour les faire évoluer efficacement vers des milliers de milliards de paramètres. Désormais, il permet à des LLM sophistiqués de fonctionner directement sur des appareils de périphérie (edge devices).
Pour l'iPhone, le modèle est intelligemment partitionné. Les composants partagés cruciaux — embeddings, mécanismes d'attention, routeurs et un expert partagé — constituent les 1,4 Go qui résident en permanence dans la RAM. Pendant ce temps, 40 fichiers d'experts individuels, chacun d'environ 300 Mo et totalisant 12 Go, attendent sur le SSD. Pour chaque jeton, après que l'attention s'exécute sur le GPU, le routeur choisit huit experts spécifiques, que le moteur diffuse ensuite depuis le SSD vers la mémoire GPU, en les faisant fonctionner aux côtés de l'expert partagé. Cela implique 320 petites lectures SSD pour chaque jeton.
Le moteur de streaming à la demande
Ce modèle de 35 milliards de paramètres contourne la barrière mémoire de 20 Go en segmentant ses composants. Un cœur de 1,4 Go d'éléments essentiels se charge une fois dans la RAM, formant l'épine dorsale opérationnelle permanente du modèle et restant résident tout au long de l'inférence :
- embeddings (représentations des jetons d'entrée)
- mécanismes d'attention (compréhension contextuelle)
- routeurs (sélection des experts)
- un expert partagé (une base de référence polyvalente)
Habituellement, les modèles entiers résident dans la RAM, mais cette architecture de 35 milliards de paramètres innove. Au lieu de cela, les 12 Go restants d'experts spécialisés résident sur le SSD rapide de l'iPhone. Cette architecture permet le streaming d'experts : le système récupère ces grandes portions inactives uniquement lorsque le routeur du modèle les appelle spécifiquement, les transférant vers la mémoire GPU à la demande.
Pour chaque jeton généré par le modèle, une séquence rapide de transferts de données s'ensuit. Le routeur sélectionne dynamiquement 8 experts au sein de chacune des 40 couches, provoquant 320 lectures distinctes et minuscules directement depuis le SSD. Ce transfert de données constant et à haute vitesse permet au modèle massif de 35 milliards de paramètres de fonctionner dans les contraintes de mémoire serrées de l'iPhone.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
La nouvelle frontière pour l'IA en périphérie (Edge AI)
Ce modèle MoE de 35 milliards de paramètres fonctionnant directement sur un iPhone ouvre véritablement une nouvelle frontière pour l'IA en périphérie. Imaginez des assistants privés traitant des données utilisateur sensibles entièrement sur l'appareil, sans transfert vers le cloud, ou des outils créatifs à latence zéro générant instantanément des conceptions complexes ou des réponses textuelles. Ces avancées permettent des applications d'IA entièrement hors ligne, transformant des capacités auparavant confinées à des centres de données distants en réalités tangibles et personnelles.
Cependant, cette percée ne va pas sans défis immédiats. Le moteur de streaming à la demande, bien qu'ingénieux, génère une charge d'E/S importante, nécessitant 320 petites lectures depuis le SSD pour chaque jeton. Cet accès aux données intensif et constant augmente naturellement la consommation de la batterie et exige une gestion thermique robuste de la part du matériel compact de l'appareil.
Néanmoins, ces obstacles sont temporaires. L'avenir promet une synergie puissante entre des techniques logicielles innovantes, comme l'actuel moteur de streaming d'experts, et une accélération matérielle de plus en plus spécialisée. Le Neural Engine d'Apple, par exemple, offre un silicium dédié conçu précisément pour les charges de travail d'IA. Combinée à des frameworks et des architectures de mémoire continuellement optimisés, cette approche intégrée accélérera le chemin vers une superintelligence sur appareil grand public, rendant l'IA puissante omniprésente et intégrée de manière transparente dans notre vie quotidienne.
Foire aux questions
Qu'est-ce qu'un modèle Mixture-of-Experts (MoE) ?
Un modèle MoE est une architecture de réseau neuronal qui utilise plusieurs sous-réseaux « experts » spécialisés. Pour toute entrée donnée, un mécanisme de routage sélectionne uniquement quelques experts pour la traiter, rendant l'inférence beaucoup plus efficace que les modèles denses où l'ensemble du réseau est utilisé.
Comment l'empreinte mémoire du modèle 35B a-t-elle été réduite si radicalement ?
La RAM résidente du modèle a été réduite à seulement 1,4 Go en ne conservant que les composants partagés en mémoire. La majeure partie du modèle, les « experts », réside sur le SSD rapide du téléphone et est diffusée en mémoire à la demande pendant l'inférence.
Qu'est-ce que le « streaming d'experts » ?
C'est une technique où des parties d'un grand modèle d'IA (les « experts » dans une architecture MoE) sont stockées sur un stockage SSD plus lent et chargées dynamiquement dans une RAM ou une mémoire GPU plus rapide uniquement lorsqu'elles sont nécessaires pour un calcul spécifique, puis supprimées.
Quels sont les avantages de faire fonctionner de grands modèles d'IA sur un téléphone ?
Les principaux avantages sont une confidentialité renforcée puisque les données ne quittent jamais l'appareil, une latence plus faible sans aller-retour réseau, une fonctionnalité hors ligne complète et une dépendance réduite vis-à-vis d'une infrastructure cloud coûteuse pour l'inférence.

