Skip to content
research

Cette astuce permet de faire tourner un LLM 35B sur votre iPhone

Tout le monde pense que l'IA sur appareil est limitée aux petits modèles, mais une nouvelle technique vient de briser cette idée reçue. La percée ne vient pas d'une nouvelle puce, mais d'une astuce de mémoire ingénieuse pour laquelle le système d'exploitation d'Apple était déjà secrètement parfait.

Aki Tanaka
Cette astuce permet de faire tourner un LLM 35B sur votre iPhone

Le modèle de 20 Go dans votre iPhone de 8 Go

Des chercheurs en IA ont récemment réalisé un exploit remarquable : déployer le grand modèle de langage Qwen 3.5, un mastodonte de 35 milliards de paramètres, directement sur un iPhone standard. Il ne s'agit pas d'une simple démonstration ; le modèle délivre 11 jetons par seconde, transformant un appareil de poche en un puissant moteur d'IA local.

Un tel modèle exige généralement une mémoire immense. Un modèle de 35B paramètres, même quantifié en précision 4 bits, nécessite environ 20 gigaoctets (Go) de RAM. Cela dépasse largement la mémoire physique disponible sur la plupart des appareils mobiles, souvent limitée à 8 Go, créant un obstacle fondamental pour l'IA sur appareil.

Surmonter cette contrainte repose sur l'architecture Mixture of Experts (MoE). Contrairement aux modèles denses traditionnels où chaque paramètre est activé pour chaque calcul, les modèles MoE sont activés de manière parcimonieuse. Pour toute entrée donnée, un composant « routeur » sélectionne et active intelligemment seulement un petit sous-ensemble d'« experts » spécialisés au sein du modèle.

Cette activation parcimonieuse modifie fondamentalement la gestion de la mémoire. Au lieu de charger l'intégralité du modèle de 20 Go dans la RAM, seuls les experts actuellement actifs, ainsi que les composants essentiels comme les mécanismes d'attention, doivent résider dans la mémoire active. Cela réduit considérablement l'empreinte mémoire en temps réel, permettant à la majeure partie du modèle de rester sur un stockage plus lent et plus vaste, comme le SSD de l'iPhone, jusqu'à ce qu'elle soit nécessaire.

SSD vers GPU : Le pipeline d'experts à la demande

Faire tourner un LLM de 35B paramètres sur la mémoire limitée d'un iPhone nécessite une stratégie ingénieuse de partitionnement de la mémoire. Un noyau compact de 1,4 Go de composants essentiels du modèle reste résident en RAM, comprenant :

  • Les embeddings
  • Les mécanismes d'attention
  • Les routeurs
  • Un expert partagé

Les 12 Go restants, composés des 40 fichiers experts du modèle (environ 300 Mo chacun), résident sur le SSD haute vitesse de l'iPhone.

Pour chaque jeton généré, le système initie un processus de récupération dynamique. Un routeur interne sélectionne huit experts spécifiques par couche parmi les 256 options du modèle, sur l'ensemble des 40 couches. Le moteur lit ensuite ces fichiers experts choisis directement depuis le SSD vers la mémoire du GPU. Cela entraîne environ 320 petites lectures par jeton, garantissant que seuls les paramètres nécessaires sont chargés pour un calcul immédiat.

Ce streaming d'experts à la demande réduit considérablement l'empreinte mémoire active. Bien que le modèle Qwen 3.5 compte 35 milliards de paramètres, seuls environ 3 milliards sont actifs pour un jeton donné. Une telle allocation efficace des ressources est essentielle pour faire fonctionner un modèle de cette ampleur sur du matériel grand public, en exploitant le SSD comme une « RAM virtuelle » étendue et haute vitesse pour la grande majorité des paramètres inactifs.

Pourquoi le système d'exploitation d'Apple a surpassé un cache personnalisé

Les développeurs avaient initialement implémenté un cache personnalisé substantiel de 9,8 Go au sein de leur application pour gérer les données des experts. Contre toute attente, la suppression de ce système sur mesure au profit du cache de page natif d'iOS a permis une augmentation remarquable de 38 % des performances. Ce résultat inattendu met en lumière un principe fondamental de la conception des systèmes d'exploitation.

Allouer un bloc de RAM aussi grand et fixe pour le cache exclusif de l'application s'est avéré préjudiciable. Cette stratégie a involontairement affamé deux ressources système critiques : le GPU, qui nécessite une mémoire importante pour les calculs, et les mécanismes de mise en cache dynamiques et sophistiqués du système d'exploitation lui-même. La réservation explicite de mémoire par l'application entrait essentiellement en conflit avec le système d'exploitation, au lieu de le compléter.

Le page cache d'iOS s'est révélé être le héros méconnu, gérant dynamiquement la RAM disponible. Il conserve intelligemment en mémoire les experts fréquemment sollicités, anticipant les besoins futurs. Ce système est bien plus efficace, s'adaptant aux exigences globales du système et assurant une allocation mémoire optimale pour tous les processus sans nécessiter de pré-allocation par l'application.

Répondre aux exigences strictes de vitesse de lecture de plus de 5 Go/s est essentiel pour maintenir 11 jetons par seconde. Le stockage flash physique de l'iPhone, cependant, plafonne à environ 1,6 Go/s. Par conséquent, le système d'exploitation orchestre la majorité des lectures d'experts directement depuis la RAM via son page cache, un facteur critique pour des modèles comme la variante Qwen 3.5 A3B. Apprenez-en davantage sur son architecture sur Qwen3.5-35B-A3B - ModelScope.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

Compression plus intelligente et dissipateurs thermiques réels

Atteindre ces performances natives sur iPhone a également nécessité une approche nuancée de la compression de modèle : la quantification par paliers (tiered quantization). Les développeurs ont observé qu'environ 25 % des « experts » du modèle Mixture of Experts (MoE) effectuaient près de 80 % du travail. Ces experts « chauds » fréquemment consultés conservent une précision de 4 bits de meilleure qualité, préservant ainsi les informations critiques.

En revanche, les experts « froids » restants, moins utilisés, subissent une compression plus profonde, réduisant leur taille à seulement 2 bits. Ce traitement différentiel intelligent réduit l'empreinte de stockage globale du modèle de 34 %, le faisant passer de 19 Go à 13 Go.

Cette réduction significative de la taille sur disque impacte directement les performances, permettant à une plus grande partie des poids du modèle Qwen 3.5 de résider dans l'efficace page cache d'iOS. Le fait de loger davantage de données dans une mémoire rapide contribue substantiellement à la vitesse de génération observée de 11 jetons par seconde, minimisant la dépendance aux lectures SSD plus lentes.

Une telle puissance de calcul soutenue sur un appareil mobile compact génère inévitablement une chaleur importante ; les utilisateurs rapportent que l'iPhone devient sensiblement chaud, allant même jusqu'à « me brûler la main » selon un développeur. Cela souligne les défis thermiques pratiques liés à la poussée de l'inférence IA dans ses retranchements sur du matériel grand public.

De plus, les développeurs ont rencontré un bug critique où le modèle restait bloqué dans une boucle infinie, répétant des jetons après quelques mots. La fonction async_pread_wait, responsable de la lecture des données des experts depuis le stockage, nécessitait une correction urgente. Elle échouait initialement à valider correctement les lectures pour les experts « froids » de 2 bits, les ignorant silencieusement et faisant fonctionner le modèle avec des informations incomplètes. Corriger cet oubli était crucial pour obtenir une sortie stable et cohérente.

Foire aux questions

Quelle est la technique principale qui permet à un modèle 35B de fonctionner sur un iPhone ?

La technique exploite une architecture de modèle Mixture of Experts (MoE). Au lieu de charger l'intégralité du modèle de 20 Go dans la RAM, seul un noyau de 1,4 Go reste résident, tandis que le reste des « experts » du modèle est diffusé depuis le stockage SSD rapide du téléphone à la demande, au fur et à mesure des besoins pour chaque génération de jetons.

Quel modèle a été utilisé lors de la démonstration ?

La démonstration a utilisé Qwen 3.5, un modèle Mixture of Experts de 35 milliards de paramètres. Plus précisément, il s'agit de la variante A3B, ce qui signifie qu'environ 3 milliards de paramètres seulement sont actifs pour chaque jeton.

Qu'est-ce qu'un modèle Mixture of Experts (MoE) ?

Un MoE est une architecture de réseau de neurones où le modèle est composé de nombreux réseaux « experts » plus petits. Pour toute entrée donnée, un mécanisme de routage sélectionne un petit sous-ensemble de ces experts pour la traiter. Cette activation creuse les rend très efficaces pour l'inférence.

Quel type de performance a été atteint sur l'iPhone ?

La configuration a atteint une vitesse de génération de 11 jetons par seconde. Cependant, ce niveau de traitement a provoqué une surchauffe notable et rapide de l'iPhone.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Pour les builders

Cette page travaille pour l’outil de quelqu’un d’autre.

Les agents IA la lisent. Des acheteurs y arrivent. Elle répond en huit langues et via MCP. Votre outil peut avoir la sienne — en ligne en 24 heures.