Le problème des 700 Go sur votre ordinateur portable
Faire tourner un modèle d'IA de classe frontier comme GLM-5.2 sur votre ordinateur portable semble impossible, et pour cause. Ce mastodonte de 744 milliards de paramètres est conçu pour les centres de données, exigeant des centaines de gigaoctets de stockage rien que pour ses poids. C'est bien plus de RAM que n'importe quelle machine grand public, même haut de gamme, ne peut offrir.
Alors, comment faire tenir quelque chose qui ne rentre tout simplement pas ? Le secret réside dans l'architecture ingénieuse Mixture of Experts (MoE) de GLM-5.2. Au lieu d'un réseau neuronal monolithique, il est structuré comme des milliers de sous-réseaux « experts » plus petits et spécialisés, chacun adapté à différentes tâches ou types de données.
Cette conception crée une opportunité d'optimisation massive. Pour toute tâche ou entrée spécifique, le modèle n'engage pas la totalité des 744 milliards de paramètres. Il achemine intelligemment la requête vers une infime fraction de ces experts seulement, environ 40 milliards de paramètres, soit environ 5 % du total. Cette parcimonie signifie que l'empreinte mémoire active à tout instant est considérablement plus petite, même si le modèle complet est énorme. C'est l'écart qu'un outil comme Colibrì exploite pour amener de tels modèles sur votre bureau.
Le secret n'est pas le GPU, c'est votre SSD
La véritable astuce de Colibrì ne consiste pas simplement à ajouter plus de GPU au problème. Il traite intelligemment le matériel de votre machine comme une hiérarchie de mémoire à trois niveaux : la VRAM de votre GPU, la RAM système de votre ordinateur et votre rapide NVMe SSD. Cette approche par couches est cruciale pour gérer des modèles comme GLM-5.2 localement.
Le cœur du modèle, ces petits composants denses utilisés pour chaque jeton (environ 17 milliards de paramètres), reste en permanence dans la RAM de votre système. Ce sont les parties toujours actives, consommant moins de 10 Go en quantification int4, garantissant que les opérations essentielles sont rapides et réactives.
Les milliers de réseaux massifs Mixture of Experts (MoE), qui constituent la majeure partie des 744 milliards de paramètres de GLM-5.2, résident sur votre SSD. C'est là que la taille énorme du modèle est gérée sans surcharger la RAM limitée de votre machine.
Lorsque GLM-5.2 a besoin d'un expert spécifique pour un jeton particulier, Colibrì ne charge pas le modèle entier. Au lieu de cela, il diffuse uniquement cette pièce nécessaire directement du disque vers la mémoire, l'utilise, puis la met en cache. Ce chargement et cette mise en cache à la demande changent la donne en termes d'efficacité.
Et Colibrì y parvient avec une efficacité remarquable. Vincenzo Fornaro a construit tout le moteur en C pur sans aucune dépendance externe. Cette implémentation légère signifie moins de surcharge, une exécution plus rapide et un outil vraiment portable capable de faire fonctionner ces modèles massifs là où ils ne devraient tout simplement pas tenir.
MacBook vs Workstation : Le goulot d'étranglement exposé
Sur un MacBook M2 Max avec 32 Go de RAM, faire tourner GLM-5.2 à partir d'un SSD externe lent s'est avéré douloureusement lent. Le modèle avançait péniblement à environ 0,1 jeton par seconde. Le profilage a révélé la dure vérité : plus de 80 % du temps de traitement était passé simplement à attendre que le disque fournisse les composants nécessaires du modèle. Le calcul réel, même sur le M2 Max, n'a pris que 7 secondes pour un tour complet, éclipsé par plus de deux minutes de latence disque.
En passant à une station de travail plus musclée avec un GPU RTX 5090 et 64 Go de RAM, la différence a été immédiate. En stockant le modèle de 357 Go sur un SSD NVMe interne rapide, les performances ont été multipliées par huit pour atteindre 0,8 jeton par seconde. Le premier mot est apparu en seulement 17 secondes, une amélioration considérable par rapport aux deux minutes d'attente du MacBook. Le temps d'attente du disque a chuté de manière significative à 48 %, ce qui signifie que la machine a passé près de la moitié de son temps à calculer plutôt qu'à attendre.
Ce contraste saisissant expose le véritable goulot d'étranglement pour l'exécution de modèles 744B Mixture of Experts avec Colibrì : non pas la puissance brute du GPU, mais la capacité de la RAM et la vitesse du disque. Le puissant GPU RTX 5090 de la station de travail a été très peu sollicité ; la véritable limitation était le besoin constant de diffuser les experts du modèle depuis le stockage. Pour des informations techniques plus approfondies, y compris l'implémentation C légère de Colibrì, consultez sa page GitHub - JustVugg/Colibrì: Run GLM-5.2 (744B MoE) on a 25GB-RAM consumer machine — pure C, zero deps, experts streamed from disk. Tiny engine, immense model.. L'optimisation de ces niveaux de mémoire est essentielle pour débloquer des modèles immenses localement.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Pourquoi la RAM est le nouveau roi de l'IA
Les expériences confirment une vérité surprenante pour les modèles d'IA locaux massifs : la RAM système compte désormais plus que votre GPU haut de gamme. Nos tests avec le modèle GLM-5.2 de 744 milliards de paramètres ont montré qu'une puissante puce M2 Max sur un MacBook, même avec 32 Go de RAM, passait plus de 80 % de son temps à attendre le disque, paralysée par une mémoire insuffisante.
Même avec 32 Go, le modèle ne pouvait pas résider entièrement en mémoire, forçant des récupérations constantes et lentes depuis le SSD externe. En revanche, les 64 Go de RAM et le disque interne rapide de la station de travail ont considérablement réduit ce temps d'attente à 48 %, augmentant significativement les performances à 0,8 jeton/seconde.
Cette amélioration repose sur l'ingénieux cache d'apprentissage de Colibrì. Avec plus de RAM, ce cache peut conserver un plus grand pool de composants Mixture of Experts fréquemment utilisés et facilement disponibles. Cela transforme le temps d'attente agonisant du disque en temps de calcul réel, tirant directement parti de l'architecture creuse du modèle où seulement ~5 % des paramètres sont actifs par jeton.
Bien que le rêve d'exécuter des modèles de pointe comme GLM-5.2 à des vitesses fulgurantes sur chaque ordinateur portable ne soit pas encore tout à fait là, Colibrì prouve indéniablement que c'est possible. L'avenir de l'IA locale puissante ne repose pas uniquement sur la vitesse brute de la puce ; il s'agit d'une gestion intelligente de la mémoire et de faire en sorte que chaque gigaoctet de RAM compte.
Foire aux questions
Qu'est-ce que Colibri ?
Colibri est un moteur d'inférence léger et open-source écrit en C pur qui permet à des modèles de langage massifs Mixture-of-Experts (MoE), comme le GLM-5.2 de 744B paramètres, de fonctionner sur du matériel grand public avec une RAM limitée.
Comment Colibri exécute-t-il un modèle aussi volumineux sur du matériel normal ?
Il exploite l'architecture MoE, où seule une fraction du modèle est active par jeton. Colibri conserve les petites parties denses du modèle dans la RAM et diffuse les réseaux d'experts plus larges depuis votre SSD NVMe à la demande, traitant votre stockage comme une extension de votre mémoire.
Quel matériel dois-je utiliser pour faire fonctionner Colibri avec GLM-5.2 ?
Vous avez besoin d'un SSD NVMe rapide avec au moins 360 Go d'espace libre pour le modèle, ainsi qu'un minimum de 25 Go de RAM système. Les performances augmentent considérablement avec plus de RAM et des vitesses d'E/S disque plus rapides.
Colibri est-il aussi rapide qu'un modèle d'IA basé sur le cloud ?
Non. Bien qu'il rende l'exécution locale possible, ce n'est pas un remplacement direct de la vitesse des modèles basés sur le cloud. Les performances peuvent être lentes, surtout lors des premières exécutions, la vitesse dépendant fortement de votre RAM et de votre SSD.
En quoi Colibri est-il différent d'outils comme Ollama ou llama.cpp ?
Colibri est spécifiquement conçu pour les modèles MoE énormes et utilise un système de mémoire sophistiqué à trois niveaux (VRAM, RAM, SSD) pour gérer des modèles d'un ordre de grandeur supérieur à ce que les outils comme Ollama prennent généralement en charge sur du matériel grand public.

