Le miracle de l'IA à 2 Go sur Apple Silicon
Oubliez l'idée qu'une IA sérieuse exige des racks de serveurs. Un nouveau projet open-source brise les attentes en faisant tourner un modèle de 26 milliards de paramètres sur Apple Silicon avec seulement ~2 Go de RAM. Plus précisément, le modèle Gemma 4 (26B-A4B) optimisé pour les instructions atteint plus de 23 jetons/seconde sur un Mac série M, offrant une inférence locale réellement utilisable sans effort.
Cet exploit réduit considérablement l'empreinte mémoire typique pour un modèle de cette envergure. Normalement, un modèle de 26 milliards de paramètres comme Gemma 4 exige plus de 14 Go de RAM. Turbo Fieldfare réalise une réduction de 7x de la mémoire, modifiant fondamentalement ce qui est possible pour le déploiement local de LLM et rendant une IA puissante accessible directement sur votre station de travail.
Le projet responsable est Turbo Fieldfare, une application open-source méticuleusement conçue pour le matériel d'Apple. Écrite spécifiquement en Swift et Metal, l'API GPU bas niveau d'Apple, elle tire parti des capacités uniques de la mémoire unifiée. Cette conception sur mesure maximise les performances sur Apple Silicon, transformant un modèle complexe Mixture-of-Experts (MoE) en une expérience locale fluide.
Pourquoi la majeure partie de votre modèle d'IA est du poids mort
Gemma 4 n'est pas un réseau monolithique. C'est un modèle Mixture-of-Experts (MoE), une conception qui brise le paradigme traditionnel du réseau unique. Au lieu d'un seul bloc de propagation avant géant, il déploie 128 réseaux d'« experts » plus petits et spécialisés. Chaque expert gère des modèles de données spécifiques, rendant le modèle global très efficace et adaptable sans activation complète constante.
Chaque couche MoE comprend un minuscule routeur. Pour tout jeton donné, ce routeur sélectionne et active dynamiquement uniquement les 8 experts les plus pertinents parmi les 128 disponibles. Cela signifie qu'environ 3,9 milliards de paramètres sur les 26 milliards de Gemma 4 sont activement engagés. Un nombre stupéfiant de 85 % des paramètres totaux du modèle restent complètement inactifs à tout moment.
Cette inactivité inhérente est l'exploitation principale de Turbo Fieldfare. Vous n'avez pas besoin de l'empreinte totale de 14 Go de Gemma 4 en RAM lorsque 85 % sont du poids mort. Le projet conserve intelligemment en mémoire uniquement les composants toujours nécessaires et les ~3,9 milliards de paramètres activement sélectionnés. Les experts sont diffusés directement depuis le SSD, juste à temps, contournant le besoin de résidence complète du modèle. Cette gestion précise de la mémoire à la demande est la façon dont Apple Silicon réalise son miracle de 2 Go.
L'arme secrète d'Apple : la mémoire unifiée
Les architectures PC traditionnelles créent un goulot d'étranglement pour l'inférence IA. Normalement, transférer des poids vers un GPU discret implique un chemin tortueux : les données passent du SSD à la RAM système, puis traversent le bus PCIe lent vers la VRAM dédiée. Cela représente deux copies et un saut de bus pour chaque bloc de données, un tueur de performances lorsque vous diffusez des experts à la demande.
Apple Silicon contourne entièrement cela avec la mémoire unifiée. Le CPU et le GPU partagent le même pool de RAM physique. Il n'y a pas de VRAM séparée dans laquelle copier. Un tampon Metal est simplement une région de cette mémoire partagée, instantanément visible par les deux processeurs.
Cette architecture permet une optimisation critique : le CPU extrait les poids des experts directement du SSD vers un tampon mémoire auquel le GPU accède immédiatement. Zéro copie lente. Zéro transfert PCIe. L'impact sur la latence est considérablement réduit, rendant viable le chargement des experts juste à temps.
De plus, le projet Turbo Fieldfare pousse cela à l'extrême. Les poids ne sont pas stockés dans un format générique nécessitant une conversion lors de l'exécution. Au lieu de cela, ils existent sur le disque dans la disposition quantifiée 4 bits exacte que le noyau GPU Metal consomme. Cela signifie zéro surcharge de conversion ou de décompression ; la lecture du fichier charge littéralement le poids. Pour en savoir plus sur ce projet, consultez drumih/turbo-fieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook · GitHub. Cette intégration étroite débloque des performances incroyables.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Plus intelligent que votre RAM : streaming à la demande
La stratégie mémoire de Turbo Fieldfare utilise un système ingénieux à deux piles. Un composant léger et essentiel de 1,35 Go — l'attention, le routeur et les embeddings — est memory-mapped et réside en permanence dans la RAM. Ce bloc critique gère le traitement initial des jetons sans toucher au disque.
Les 12,9 Go d'experts restants résident entièrement sur le SSD. Turbo Fieldfare utilise une stratégie de récupération juste-à-temps (JIT), diffusant ces experts en mémoire uniquement lorsque le routeur les appelle, quelques mégaoctets à la fois. Pas de pré-chargement ; les choix dépendent du jeton actuel et de son historique.
La mise en cache intelligente affine encore ce processus. Chacune des 30 couches de Gemma 4 maintient un cache LFU, conservant 16 de ses 128 experts en RAM. Si le routeur choisit un expert mis en cache, l'accès est immédiat. Sinon, l'expert requis est chargé depuis le SSD, remplaçant celui le moins fréquemment utilisé actuellement en mémoire.
Cette approche LFU tire parti de la nature non aléatoire et prévisible de la sélection d'experts dans les modèles MoE. Certains experts sont choisis systématiquement ; d'autres rarement. En donnant la priorité aux experts fréquemment utilisés, le système minimise les lectures sur disque, masquant efficacement la latence d'E/S au sein des threads de calcul existants du modèle.
Foire aux questions
Qu'est-ce que Turbo Fieldfare ?
Turbo Fieldfare est un projet open-source qui exécute de grands modèles d'IA comme Gemma 4 avec 26B de paramètres sur des Mac Apple Silicon avec aussi peu que 2 Go de RAM en diffusant des parties du modèle directement depuis le SSD.
Pourquoi la mémoire unifiée d'Apple Silicon est-elle importante pour cela ?
Elle permet au CPU et au GPU de partager le même pool de mémoire. Cela élimine le processus lent de copie de données de la RAM système vers une VRAM GPU séparée, ce qui est crucial pour le streaming de données haute vitesse à la demande utilisé par Turbo Fieldfare.
Qu'est-ce qu'un modèle Mixture-of-Experts (MoE) ?
Une architecture de modèle d'IA composée de plusieurs sous-réseaux 'experts' plus petits. Pour toute tâche donnée, un routeur ne sélectionne que quelques experts à activer, rendant l'inférence beaucoup plus efficace que l'exécution d'un seul grand modèle monolithique.
Puis-je exécuter cela sur mon Mac ?
Oui, si vous avez un Mac de série M (Apple Silicon). Le projet est disponible sur GitHub avec des instructions pour cloner le dépôt et exécuter l'application.

