Le résultat de 6,6 secondes a un piège
Strata a fait tourner un modèle Qwen 3.8 Flash-Next de 125 milliards de paramètres localement, terminant une requête à réponse longue en 6,6 secondes. Le même test, exécuté via le service cloud d'OpenRouter, a pris 33 secondes. Cet avantage de vitesse locale de 5x est également apparu dans les tâches de codage et d'écriture créative.
Le créateur Niko1221 a observé des performances variables selon les benchmarks. Un court puzzle logique, par exemple, a abouti à une quasi-égalité : 1,4 seconde localement contre 1,5 seconde dans le cloud. Les résultats ont systématiquement varié en fonction de la complexité de la tâche et de la longueur de la réponse, soulignant le comportement adaptatif du modèle.
Il est crucial de noter que plusieurs mises en garde tempèrent la comparaison directe. Le modèle local utilisait une version quantifiée 2-bit, intrinsèquement plus petite et plus rapide qu'une variante en pleine précision. Les configurations matérielles du cloud et la charge du fournisseur étaient des variables non contrôlées, faussant potentiellement les résultats. De plus, la configuration locale exploitait un GPU RTX 5090 avec 32 Go de VRAM, un composant haut de gamme dépassant largement les capacités du matériel grand public typique.
Ces facteurs suggèrent que l'accélération impressionnante dépend de conditions spécifiques. L'approche innovante de Strata en matière de traitement distribué entre GPU, CPU, RAM et SSD permet certainement l'exécution locale de modèles massifs, mais la comparaison avec les services cloud reste complexe.
Comment un modèle 125B tient sur un ordinateur de bureau
Atteindre une inférence locale avec un modèle de 125 milliards de paramètres comme Qwen 3.8 Flash-Next peut sembler impossible, étant donné que même un GPU de premier plan comme une RTX 5090 ne dispose que de 32 Go de VRAM. Le secret réside dans l'architecture Mixture-of-Experts (MoE) du modèle, que Strata exploite ingénieusement. Bien que le modèle total soit de 125B paramètres, seuls environ 6 milliards sont actifs pour un jeton donné, avec un petit sous-ensemble d'experts sélectionnés dynamiquement.
Strata distribue intelligemment la charge de travail sur les ressources de votre PC. Les composants partagés du modèle et les experts fréquemment consultés résident dans la VRAM du GPU. Les 24 576 experts sont cependant stockés dans la RAM système, permettant un accès rapide.
Une table de recherche d'environ 29 Go reste sur le SSD. Strata récupère de manière préventive les petites lignes nécessaires, éliminant les goulots d'étranglement d'E/S et assurant un fonctionnement fluide. Cette stratégie de mémoire hiérarchisée permet à un modèle vraiment massif de fonctionner sur du matériel grand public.
La configuration de la vidéo met en évidence le matériel requis :
- Une RTX 5090 avec 32 Go de VRAM
- Un processeur Core Ultra 9 285K
- 62 Go de RAM
- Environ 80 Go d'espace disque libre pour l'installation.
Cette configuration démontre qu'avec un logiciel optimisé comme Strata, l'inférence d'IA locale haute performance est de plus en plus accessible.
La « sonnette » permet au CPU et au GPU de faire équipe
L'innovation principale de Strata réside dans son orchestration astucieuse du matériel hétérogène. Le GPU, après avoir identifié les dix experts nécessaires pour une couche donnée, signale leurs identifiants via un segment de mémoire partagée, judicieusement appelé la « sonnette » (doorbell). Cette notification permet au CPU de commencer simultanément le traitement dans la RAM système.
Contrairement au simple déchargement de couches entières, Strata assigne dynamiquement les experts disponibles au GPU et envoie tout défaut de cache directement au CPU. Cela permet aux deux processeurs de travailler en parallèle sur la même couche, éliminant le temps d'inactivité généralement associé au transfert de données et assurant un calcul continu.
Pour accélérer encore le processus, Strata intègre le speculative decoding. Un modèle auxiliaire petit et efficace propose plusieurs jetons suivants potentiels, que le modèle principal Qwen 3.8 Flash-Next vérifie ensuite en un seul lot. Cette approche a permis une accélération rapportée de 1,6 à 1,8× lors des tests, le modèle principal validant les propositions de l'assistant environ 79 % du temps, sans altérer le résultat final.
Cette approche unifiée, tirant parti de la VRAM du GPU pour les experts actifs, de la RAM système pour l'ensemble complet des experts, et même d'un SSD NVMe pour une table de recherche massive, maximise le débit. Pour plus de détails techniques sur ce projet open-source, vous pouvez explorer GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware. Strata transforme efficacement un PC de bureau en un puissant moteur d'inférence distribué.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
Une inférence rapide n'est pas synonyme de mise à niveau gratuite
Bien que l'inférence locale offre des avantages convaincants, les résultats de vitesse de Strata ne sont pas une garantie universelle de la qualité ou des performances du modèle. La quantification locale 2 bits de Qwen 3.8 Flash-Next a bien fonctionné lors des tests spécifiques de la vidéo, mais cela ne prouve pas une parité avec un modèle cloud fonctionnant potentiellement à une précision supérieure. La précision impacte souvent le raisonnement nuancé et la véracité des faits.
Strata exige également des ressources système substantielles. Le modèle 125B peut consommer presque toute la VRAM disponible (par exemple, 32 Go sur une RTX 5090) et une part importante de la RAM système (jusqu'à 39 Go dans la vidéo). Le premier chargement du modèle peut bloquer un PC pendant plusieurs minutes, et des conversations plus longues ou des invites différentes peuvent modifier le débit, comme la vidéo elle-même l'a noté.
Ces benchmarks impressionnants sont spécifiques au système. Par exemple, l'accélération de 3 à 5× observée dans la vidéo sur une RTX 5090 n'est pas directement comparable à une configuration disposant de 12 Go de VRAM ou moins de RAM système.
En fin de compte, l'inférence locale offre confidentialité, contrôle utilisateur et un faible coût marginal en électricité. Les services cloud, à l'inverse, évitent l'investissement initial dans des GPU haut de gamme et peuvent offrir une meilleure précision ainsi qu'un accès constant à des modèles puissants. Les résultats de Strata sont une démonstration convaincante de ce qui est possible avec des logiciels et du matériel optimisés, et non une mise à niveau gratuite pour chaque utilisateur.
Questions fréquemment posées
Qu'est-ce que Strata ?
Strata est un moteur d'inférence open-source conçu pour exécuter Qwen 3.8 Flash-Next localement en répartissant le travail entre le GPU, le CPU, la RAM système et le SSD.
Comment le modèle local a-t-il battu le cloud dans la vidéo ?
Sur le PC RTX 5090 du créateur, Strata a terminé une réponse longue en 6,6 secondes, contre 33 secondes pour l'exécution dans le cloud. Les résultats dépendent des invites, du matériel, de la charge du fournisseur et des paramètres.
Quel PC faut-il pour exécuter Strata ?
La vidéo indique un minimum de 12 Go de VRAM, 32 Go de RAM système et environ 80 Go d'espace disque libre. Plus de mémoire et un SSD rapide peuvent aider ; le modèle a utilisé une quantité substantielle de RAM et de VRAM.
Strata est-il plus rapide que l'IA cloud pour toutes les tâches ?
Non. Le test de logique de la vidéo était essentiellement une égalité, et les performances du cloud varient. Le résultat local utilisait également un modèle quantifié 2 bits, donc les comparaisons de vitesse n'établissent pas une précision égale.

