Skip to content
ai tools

Cet outil fait tourner l'IA de datacenter sur votre PC

Faire tourner des modèles d'IA de pointe avec des centaines de milliards de paramètres relevait autrefois de la fantaisie pour quiconque ne possédait pas de datacenter. Mais un nouveau moteur open-source change la donne, non pas en utilisant plus de VRAM, mais en la traitant comme un cache CPU.

Nora Vance
Cet outil fait tourner l'IA de datacenter sur votre PC

Pourquoi les modèles d'IA géants saturent votre GPU

Les modèles d'IA géants, en particulier les modèles mixture of experts (MoE), posent un défi unique aux GPU grand public. Prenons DeepSeek V4-Flash : il affiche un nombre impressionnant de 284 milliards de paramètres au total. Pourtant, pour chaque jeton, seule une infime fraction — environ 13 milliards — est activement utilisée. Bien que cette partie active puisse tenir sur de nombreux GPU, l'intégralité des 284 milliards de paramètres doit résider quelque part, généralement dans la RAM système, car vous ne savez pas quels experts seront nécessaires ensuite.

Les moteurs d'inférence traditionnels comme Ollama peinent face à cette réalité dynamique. Lorsqu'un modèle MoE dépasse la VRAM de votre GPU — par exemple, un modèle Qwen 3.6 35B de 38 Go sur une carte de 32 Go — Ollama a recours à une solution statique. Il divise le modèle de manière permanente, déchargeant des couches vers le CPU (par exemple, 30 % sur le CPU, 70 % sur le GPU). Cela signifie que chaque jeton, quels que soient les experts dont il a besoin, doit traverser chaque couche, forçant un détour lent par le CPU pour une partie importante. Lors des tests, cela n'a donné que 58 jetons par seconde.

FreeToken propose une approche fondamentalement différente. Il abandonne le placement statique pour reformuler le problème sous forme de planification dynamique. La VRAM de votre GPU devient un cache intelligent pour les experts fréquemment consultés, le modèle complet résidant dans la RAM système ; seuls les experts activement nécessaires sont transmis au GPU à la demande. Ce système dynamique basé sur le cache est bien mieux adapté aux modèles MoE, qui réutilisent souvent les mêmes experts d'un jeton à l'autre, maintenant ainsi le calcul sur le GPU plus rapide.

Le secret de FreeToken : la planification, pas le fractionnement

FreeToken repense la façon dont votre PC gère les modèles massifs de type mixture of experts. Au lieu d'essayer de faire tenir l'intégralité des 284 milliards de paramètres de DeepSeek V4-Flash sur votre GPU, FreeToken traite votre GPU VRAM comme un cache haute vitesse. Le modèle complet réside dans la RAM système, seuls les experts les plus récemment utilisés étant dynamiquement transférés dans la VRAM. Comme les modèles réutilisent souvent les experts d'un jeton à l'autre, cette stratégie réduit considérablement le trafic mémoire.

Lorsque vous envoyez une invite pour la première fois (la phase de "prefill"), les modèles doivent généralement accéder à de nombreux experts, ce qui peut ralentir le processus. FreeToken utilise le double buffering pour masquer cette latence. Pendant que votre GPU traite la couche actuelle, l'outil diffuse simultanément les experts de la couche suivante depuis la RAM système via PCIe, gardant le GPU occupé et évitant les temps d'attente inutiles.

Lors de la génération proprement dite, un défaut de cache se produit lorsqu'un expert n'est pas présent sur le GPU. La politique Q\* policy intelligente de FreeToken entre alors en jeu. Elle mesure automatiquement les vitesses spécifiques PCIe et RAM de votre PC, décidant à la volée s'il est plus rapide de transférer l'expert manquant vers le GPU ou de le calculer directement sur le CPU. Ce fractionnement dynamique optimise les performances pour votre matériel unique, que vous ayez une liaison PCIe étroite ou une RAM rapide.

Mise à l'épreuve de la promesse de vitesse multipliée par 3

Alors, FreeToken a-t-il réellement tenu ses promesses ? La vidéo l'a soumis à un véritable test en conditions réelles, en le confrontant à Ollama avec un scénario difficile : un modèle mixture of experts de 38 Go sur un GPU grand public équipé de seulement 32 Go de VRAM. Cette configuration est spécifiquement conçue pour mettre en échec les moteurs d'inférence traditionnels, les forçant à décharger une partie importante du modèle vers une RAM système plus lente.

Dans cette situation, Ollama divise le modèle par couche, en transférant environ 30 % sur le CPU. Cela signifie que chaque jeton fait un détour par le CPU lent pour certaines couches, provoquant des goulots d'étranglement importants. En conséquence, Ollama a progressé très lentement dans la tâche, prenant plus de 14 minutes et 20 secondes à une vitesse poussive de 58 jetons par seconde.

FreeToken, en revanche, a terminé la exactement la même tâche en seulement 4 minutes et 40 secondes, offrant un débit impressionnant de 132 jetons par seconde. C'est une accélération de près de 3x, ce qui fait une différence significative pour quiconque exécute des modèles plus volumineux localement lorsque la taille du modèle dépasse la VRAM du GPU.

La stratégie de mise en cache intelligente de FreeToken a également fait l'objet d'une démonstration en direct. L'outil vous permet de redimensionner son cache d'experts GPU à la volée, prouvant visuellement qu'une petite tranche d'experts « chauds » effectue la majeure partie du travail. Les chercheurs ont observé que la réduction du cache de 58 % à 40 % de la taille totale du modèle n'entraînait qu'une baisse de vitesse de 7 %. Cela valide l'idée centrale : souvent, seuls 20 à 40 % des experts du modèle sont activement utilisés, confirmant l'efficacité de la méthode de dynamic caching de FreeToken. Pour des plongées plus approfondies dans l'implémentation technique, vous pouvez explorer le projet sur GitHub - FlashML-org/FreeToken: FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently..

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

FreeToken n'est pas une solution miracle

FreeToken n'est pas une baguette magique pour toutes les tâches d'IA. Ses gains de vitesse impressionnants n'apparaissent que lorsque votre mixture of experts model dépasse la capacité VRAM de votre GPU. Souvenez-vous de ce test vidéo crucial : un modèle de 38 Go sur un GPU de 32 Go, un scénario conçu pour mettre à mal les moteurs d'inférence traditionnels.

Mais pour les modèles plus petits, l'histoire change. Un modèle quantifié en 4 bits, par exemple, qui tient confortablement dans vos 32 Go de VRAM, s'exécute en réalité plus rapidement sur Ollama. La vidéo a démontré 240 jetons par seconde avec Ollama contre 225 jetons par seconde pour FreeToken dans ce cas. L'architecture de streaming sophistiquée de FreeToken, conçue pour les surcharges de VRAM, devient une pure surcharge lorsqu'il n'y a plus rien à diffuser depuis la RAM système.

Voici donc le conseil simple : si votre modèle tient entièrement sur votre GPU, restez sur Ollama ou Llama.cpp pour des performances optimales. Ce n'est que lorsque vous souhaitez exécuter ces énormes mixture of experts models à l'échelle d'un centre de données qui ne tiendraient pas autrement sur votre matériel grand public que vous devriez passer à FreeToken. Il débloque et accélère considérablement ces modèles auparavant inaccessibles.

Foire aux questions

Qu'est-ce que FreeToken ?

FreeToken est un moteur d'inférence open-source conçu spécifiquement pour exécuter efficacement de grands modèles d'IA Mixture of Experts (MoE) sur du matériel grand public, servant d'alternative haute performance à des outils comme Ollama ou Llama.cpp pour cette tâche spécifique.

Comment FreeToken rend-il les modèles d'IA plus rapides ?

Au lieu de diviser en permanence les couches du modèle entre le CPU et le GPU, FreeToken traite la VRAM du GPU comme un cache dynamique pour les « experts » les plus utilisés. Il utilise une planification intelligente, une double mise en mémoire tampon et une co-exécution adaptative CPU-GPU pour minimiser la latence de transfert de données, surtout lorsque le modèle est plus grand que la VRAM disponible.

FreeToken est-il toujours plus rapide qu'Ollama ?

Non. L'avantage principal de FreeToken se manifeste lorsqu'un modèle MoE est trop volumineux pour tenir dans la VRAM de votre GPU. Si un modèle tient confortablement dans la VRAM, Ollama ou Llama.cpp seront probablement plus rapides car l'architecture de streaming de FreeToken introduit une surcharge inutile.

Dans quels types de modèles FreeToken se spécialise-t-il ?

FreeToken est conçu spécifiquement pour les modèles Mixture of Experts (MoE), tels que DeepSeek-V4-Flash, Qwen3.6-35B et GLM-5.2. Son architecture est optimisée pour gérer l'activation dynamique des 'experts' propre à ces modèles.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only