Skip to content
ai tools

La promesse de vitesse 2x de Magnitude comporte un piège

Un benchmark proche de 2x semble être une avancée majeure, jusqu'à ce que l'on examine ce qui a été mesuré, sur quel Mac et par rapport à quelle configuration. L'essentiel n'est peut-être pas une victoire de vitesse universelle, mais plutôt une nouvelle façon de créer des outils d'IA locaux.

Theo Brandt
La promesse de vitesse 2x de Magnitude comporte un piège

L'astuce ingénieuse : benchmarker le Mac, pas la machine moyenne

Des moteurs comme llama.cpp et Ollama sont livrés avec des noyaux précompilés. Cela maximise la portabilité ; une seule version fonctionne sur diverses puces. Cependant, cette commodité sacrifie souvent les performances pour un appareil spécifique.

Magnitude adopte une approche différente. Lorsque vous téléchargez un modèle, il exécute une série de micro-benchmarks directement sur votre Mac. Il teste diverses configurations de noyau, les chronomètre et met en cache la plus rapide. Ce processus de réglage sur l'appareil prend environ une minute.

Vous rencontrerez deux mesures de performance clés : prefill et decode. Le prefill mesure la vitesse à laquelle le moteur traite votre invite. Le decode, quant à lui, suit la vitesse de génération des jetons, un par un.

La vitesse de decode est souvent le facteur le plus perceptible dans les flux de travail d'agents interactifs, surtout lorsque vous attendez qu'un agent de codage diffuse sa sortie. La promesse de vitesse 2x de Magnitude cible spécifiquement cette performance de decode.

Conçu pour les agents, et étonnamment facile à connecter

La configuration pratique est simple. Choisissez un modèle recommandé dans l'onglet Discover, téléchargez-le, et Magnitude le règle pendant environ une minute. Ensuite, connectez Claude Code, Codex, OpenCode, Cline ou Pi via ses API locales compatibles — les points de terminaison d'API OpenAI et Anthropic sont exposés sur localhost.

La conception axée sur les agents de Magnitude le différencie. Le moteur optimise les flux de travail multi-sessions :

  • Caches d'invites partagés entre les sessions
  • Mémoire gérée dynamiquement
  • Cache KV compressé (clés en 8 bits, valeurs en 4 bits)
  • Les modèles se déchargent lorsqu'ils sont inactifs

Cela positionne Magnitude de manière unique. llama.cpp et Ollama privilégient une large portée matérielle, tandis que MLX se spécialise dans Apple Silicon. Les moteurs de serveur comme vLLM ciblent le traitement par lots pour l'inférence en centre de données. Magnitude, cependant, se concentre sur le réglage local et les flux de travail d'agents. Il mesure votre machine exacte, s'y adapte et se construit autour d'agents à exécution longue. Cette approche offre des avantages spécifiques aux développeurs utilisant des assistants IA locaux.

Le résultat presque 2x ne raconte pas toute l'histoire

Les résultats des tests principaux pour la promesse 2x de Magnitude montrent des nuances. Sur un M4 Pro, Qwen 3.6 35B A3B (4 bits, contexte 64K) a atteint 57 jetons par seconde pour le decode, soit un gain de 92 % par rapport aux 30 jetons/s de llama.cpp. Le prefill, cependant, ne s'est amélioré que de 9 %. Le "2x" est largement une mesure centrée sur le decode.

Cette comparaison n'est pas universelle. Un Nvidia DGX Spark exécutant le même test a vu les gains de decode chuter à 19 %. Il est crucial de noter que le test M4 Pro a été effectué avec des configurations de cache KV différentes ; le chemin de cache compressé de llama.cpp a échoué, le forçant à utiliser un cache complet de 16 bits tandis que Magnitude utilisait son cache compressé par défaut.

Des rapports indépendants compliquent encore la situation. Certains utilisateurs ont trouvé MLX ou llama.cpp plus rapides. Les rapports incluent llama.cpp dépassant Magnitude sur M5 Max et RTX 5070 Ti, et MLX surpassant Magnitude sur un M5 Max (175 jetons/s contre 161 jetons/s). Le matériel, le modèle et les paramètres spécifiques dictent clairement les performances. Pour des analyses techniques plus approfondies, consultez le dépôt GitHub - magnitudedev/magnitude: Open source inference engine for agents.

Magnitude est encore à un stade précoce (v0.2.5), et ses développeurs notent qu'il n'exploite pas encore le nouveau matériel Metal Matrix du M5. Attendez-vous à davantage de comparaisons MLX indépendantes à mesure que le projet mûrit. Les promesses de vitesse brute, bien qu'attirantes, racontent rarement toute l'histoire à travers divers matériels et charges de travail.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

Qui devrait l'installer — et qui devrait attendre

Magnitude, dans sa version 0.2.5, est une expérience précoce. Les propriétaires de Mac M1 à M4 utilisant des agents de codage locaux devraient l'installer. Les connexions en un clic à Claude Code, Codex, OpenCode, Cline ou Pi sont convaincantes, surpassant souvent les gains de débit brut pour les flux de travail des agents.

Attendez-vous à quelques imperfections. Le catalogue sélectionné propose environ 15 modèles, tous en 4 bits ou plus. Les conseils pour les GGUF personnalisés sont absents, les modèles téléchargés se cachent dans le répertoire personnel de l'utilisateur, et les déchargements en cas d'inactivité signifient des premières réponses plus lentes. Ce sont des frictions mineures pour les bidouilleurs.

Les utilisateurs de M5 à la recherche d'une vitesse maximale devraient s'en tenir à MLX pour le moment ; Magnitude n'exploite pas encore le nouveau matériel Metal Matrix du M5. Les déploiements en production nécessitent de la patience. Attendez des comparaisons indépendantes plus larges avant de vous engager.

L'idée durable est le réglage mesuré par l'appareil, et non une victoire garantie de 2x. L'approche de Magnitude consistant à optimiser les noyaux pour un matériel spécifique est une manière plus intelligente d'exécuter des LLM locaux. Même si le gain de décodage de 92 % sur un M4 Pro avec Qwen 3.6 35B A3B à 64K de contexte n'est pas universel, le principe est solide.

Questions fréquemment posées

Qu'est-ce que Magnitude ?

Magnitude est un moteur d'inférence local open-source conçu autour des agents de codage et du réglage des noyaux spécifique au matériel.

Magnitude est-il vraiment deux fois plus rapide que llama.cpp ?

Il a enregistré une vitesse de décodage presque deux fois supérieure lors d'un test sur M4 Pro, mais les résultats indépendants varient selon le matériel, le modèle et la configuration.

Comment Magnitude se règle-t-il sur un Mac ?

Il évalue différentes configurations de noyau sur l'appareil, sélectionne les options les plus rapides et les met en cache pour une utilisation ultérieure.

Magnitude peut-il se connecter à Claude Code ?

Oui. Ses API locales compatibles avec OpenAI et Anthropic prennent en charge une connexion en un clic à Claude Code et à d'autres outils d'agent.

Qui devrait essayer Magnitude maintenant ?

Les utilisateurs de Mac M1 à M4 qui souhaitent un backend local simple pour les agents de codage pourraient le trouver utile ; les utilisateurs en production devraient attendre davantage de comparaisons.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Pour les builders

Cette page travaille pour l’outil de quelqu’un d’autre.

Les agents IA la lisent. Des acheteurs y arrivent. Elle répond en huit langues et via MCP. Votre outil peut avoir la sienne — en ligne en 24 heures.