Skip to content
ai tools

Magnitudes 2x-Geschwindigkeitsversprechen hat einen Haken

Ein Benchmark, der fast eine Verdopplung der Geschwindigkeit verspricht, klingt nach einem Durchbruch – bis man sich ansieht, was gemessen wurde, auf welchem Mac und gegen welches Setup. Die wichtigere Erkenntnis ist vielleicht weniger ein universeller Geschwindigkeitsvorteil, sondern ein neuer Ansatz für den Aufbau lokaler KI-Tools.

Theo Brandt
Magnitudes 2x-Geschwindigkeitsversprechen hat einen Haken

Der clevere Trick: Den Mac benchen, nicht die Durchschnittsmaschine

Engines wie llama.cpp und Ollama werden mit vorcompilierten Kernels ausgeliefert. Dies maximiert die Portabilität; ein Build funktioniert auf verschiedenen Chips. Diese Bequemlichkeit lässt jedoch oft Performance-Potenzial für das jeweilige Gerät ungenutzt.

Magnitude verfolgt einen anderen Ansatz. Wenn Sie ein Modell herunterladen, führt es eine Reihe von Micro-Benchmarks direkt auf Ihrem Mac aus. Es testet verschiedene Kernel-Konfigurationen, misst deren Zeit und speichert die schnellste zwischen. Dieser On-Device-Tuning-Prozess dauert Berichten zufolge etwa eine Minute.

Sie werden auf zwei wichtige Leistungsmetriken stoßen: Prefill und Decode. Prefill misst, wie schnell die Engine Ihren Prompt verarbeitet. Decode hingegen verfolgt die Geschwindigkeit der Token-Generierung, Schritt für Schritt.

Die Decode-Geschwindigkeit ist oft der auffälligere Faktor bei interaktiven Agenten-Workflows, insbesondere wenn Sie darauf warten, dass ein Coding-Agent seine Ausgabe streamt. Magnitudes Behauptung einer 2x-Geschwindigkeit zielt spezifisch auf diese Decode-Performance ab.

Entwickelt für Agenten – und beeindruckend einfach anzubinden

Die praktische Einrichtung ist unkompliziert. Wählen Sie ein empfohlenes Modell aus dem Discover-Tab, laden Sie es herunter, und Magnitude optimiert es für etwa eine Minute. Verbinden Sie dann Claude Code, Codex, OpenCode, Cline oder Pi über die lokalen kompatiblen APIs – sowohl OpenAI- als auch Anthropic-API-Endpunkte sind über localhost verfügbar.

Das auf Agenten ausgerichtete Design von Magnitude ist ein Alleinstellungsmerkmal. Die Engine ist für Multi-Session-Workflows optimiert:

  • Gemeinsam genutzte Prompt-Caches über Sessions hinweg
  • Dynamisch verwalteter Speicher
  • Komprimierter KV-Cache (Keys mit 8-Bit, Values mit 4-Bit)
  • Modelle werden bei Inaktivität entladen

Dies positioniert Magnitude einzigartig. llama.cpp und Ollama priorisieren eine breite Hardware-Abdeckung, während MLX auf Apple Silicon spezialisiert ist. Server-Engines wie vLLM zielen auf Batching für Rechenzentrums-Inferenz ab. Magnitude hingegen konzentriert sich auf lokales Tuning und Agenten-Workflows. Es misst Ihre exakte Maschine, optimiert dafür und baut auf langlebige Agenten auf. Dieser Ansatz bietet spezifische Vorteile für Entwickler, die lokale KI-Assistenten betreiben.

Das fast 2x-Ergebnis erzählt nicht die ganze Geschichte

Die Schlagzeilen-Testergebnisse für Magnitudes 2x-Behauptung zeigen Nuancen. Auf einem M4 Pro erreichte Qwen 3.6 35B A3B (4-Bit, 64K Kontext) 57 Token pro Sekunde beim Decode, ein Zuwachs von 92 % gegenüber den 30 t/s von llama.cpp. Prefill verbesserte sich jedoch nur um 9 %. Das „2x“ ist weitgehend eine auf Decode fokussierte Metrik.

Dieser Vergleich ist nicht universell. Ein Nvidia DGX Spark, der denselben Test durchführte, verzeichnete einen Rückgang der Decode-Gewinne auf 19 %. Entscheidend ist, dass der M4 Pro-Test mit unterschiedlichen KV-Cache-Konfigurationen lief; der Pfad für komprimierten Cache von llama.cpp schlug fehl, was dazu führte, dass ein voller 16-Bit-Cache verwendet wurde, während Magnitude seinen standardmäßigen komprimierten Cache nutzte.

Unabhängige Berichte verkomplizieren das Bild zusätzlich. Einige Nutzer fanden MLX oder llama.cpp schneller. Berichte beinhalten, dass llama.cpp auf M5 Max und RTX 5070 Ti vor Magnitude liegt und MLX Magnitude auf einem M5 Max übertrifft (175 t/s vs. 161 t/s). Hardware, Modell und spezifische Einstellungen bestimmen eindeutig die Leistung. Für tiefere technische Einblicke besuchen Sie das GitHub - magnitudedev/magnitude: Open source inference engine for agents Repository.

Magnitude steht noch am Anfang (v0.2.5), und die Entwickler merken an, dass es die neue Metal Matrix-Hardware des M5 noch nicht nutzt. Erwarten Sie weitere unabhängige MLX-Vergleiche, während das Projekt reift. Rohe Geschwindigkeitsversprechen sind zwar aufmerksamkeitsstark, erzählen aber selten die ganze Geschichte über verschiedene Hardware-Konfigurationen und Workloads hinweg.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Wer sollte es installieren – und wer sollte warten

Magnitude ist in der Version 0.2.5 ein frühes Experiment. Besitzer von M1–M4 Macs, die lokale Coding-Agents ausführen, sollten es installieren. Die Ein-Klick-Verbindungen zu Claude Code, Codex, OpenCode, Cline oder Pi sind überzeugend und überwiegen oft die reinen Durchsatzgewinne bei Agent-Workflows.

Erwarten Sie Ecken und Kanten. Der kuratierte Katalog bietet etwa 15 Modelle, alle mit 4-Bit oder höher. Anleitungen für benutzerdefinierte GGUFs fehlen, heruntergeladene Modelle verstecken sich im Home-Verzeichnis des Benutzers, und das Entladen bei Leerlauf bedeutet langsamere erste Antworten. Für Bastler sind dies nur geringfügige Reibungspunkte.

M5-Benutzer, die maximale Geschwindigkeit anstreben, sollten vorerst bei MLX bleiben; Magnitude nutzt die neue Metal Matrix-Hardware des M5 noch nicht. Produktionseinsätze erfordern Geduld. Warten Sie auf umfassendere unabhängige Vergleiche, bevor Sie sich festlegen.

Die beständige Idee ist gerätegemessene Optimierung, kein garantierter 2x-Gewinn. Magnitudes Ansatz, Kernel für spezifische Hardware zu optimieren, ist ein intelligenterer Weg, lokale LLMs auszuführen. Auch wenn der 92%ige Dekodierungsgewinn auf einem M4 Pro mit Qwen 3.6 35B A3B bei 64K Kontext nicht universell ist, ist das Prinzip fundiert.

Häufig gestellte Fragen

Was ist Magnitude?

Magnitude ist eine Open-Source-Engine für lokale Inferenz, die auf Coding-Agents und hardwarespezifische Kernel-Optimierung ausgelegt ist.

Ist Magnitude wirklich doppelt so schnell wie llama.cpp?

In einem M4 Pro-Test wurde fast die doppelte Dekodiergeschwindigkeit aufgezeichnet, aber unabhängige Ergebnisse variieren je nach Hardware, Modell und Konfiguration.

Wie optimiert sich Magnitude auf einem Mac?

Es benchmarkt verschiedene Kernel-Konfigurationen auf dem Gerät, wählt die schnellsten Optionen aus und speichert sie zur späteren Verwendung zwischen.

Kann sich Magnitude mit Claude Code verbinden?

Ja. Seine lokalen OpenAI- und Anthropic-kompatiblen APIs unterstützen eine Ein-Klick-Verbindung zu Claude Code und anderen Agent-Tools.

Wer sollte Magnitude jetzt ausprobieren?

Mac-Benutzer mit M1 bis M4, die ein einfaches lokales Backend für Coding-Agents suchen, könnten es nützlich finden; Benutzer im Produktionsumfeld sollten auf weitere Vergleiche warten.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.