Skip to content
research

Dieses 125B AI-Modell lässt die Cloud weit hinter sich

Ein Desktop-PC übertrifft eine Cloud-KI scheinbar um Längen – doch der Benchmark verschleiert Kompromisse, die die Bedeutung der Zahlen verändern könnten. Hier ist die clevere Technik hinter diesem Ergebnis und was nötig ist, um es zu reproduzieren.

Aki Tanaka
Dieses 125B AI-Modell lässt die Cloud weit hinter sich

Das 6,6-Sekunden-Ergebnis hat einen Haken

Strata führte ein lokales 125-Milliarden-Parameter Qwen 3.8 Flash-Next Modell aus und schloss einen Prompt mit langer Antwort in 6,6 Sekunden ab. Derselbe Test, ausgeführt über den Cloud-Dienst von OpenRouter, dauerte 33 Sekunden. Dieser 5-fache lokale Geschwindigkeitsvorteil zeigte sich auch bei Programmier- und kreativen Schreibaufgaben.

Der Ersteller Niko1221 beobachtete unterschiedliche Leistungen bei verschiedenen Benchmarks. Ein kurzes Logikrätsel führte beispielsweise zu einem fast unentschiedenen Ergebnis: 1,4 Sekunden lokal gegenüber 1,5 Sekunden in der Cloud. Die Ergebnisse änderten sich konsistent mit der Aufgabenkomplexität und der Antwortlänge, was das adaptive Verhalten des Modells unterstreicht.

Entscheidend ist, dass mehrere Vorbehalte den direkten Vergleich relativieren. Das lokale Modell nutzte eine 2-bit quantisierte Version, die von Natur aus kleiner und schneller ist als eine Variante mit voller Präzision. Cloud-Hardwarekonfigurationen und die Auslastung der Anbieter waren unkontrollierte Variablen, die die Ergebnisse potenziell verfälschen könnten. Zudem nutzte das lokale Setup eine RTX 5090 GPU mit 32 GB VRAM – eine High-End-Komponente, die die typischen Fähigkeiten von Verbraucher-Hardware weit übersteigt.

Diese Faktoren deuten darauf hin, dass die beeindruckende Geschwindigkeitssteigerung von spezifischen Bedingungen abhängt. Stratas innovativer Ansatz zur verteilten Verarbeitung über GPU, CPU, RAM und SSD ermöglicht zwar die lokale Ausführung massiver Modelle, aber der Vergleich mit Cloud-Diensten bleibt komplex.

Wie ein 125B-Modell auf einen Desktop passt

Lokale Inferenz mit einem 125-Milliarden-Parameter-Modell wie Qwen 3.8 Flash-Next zu erreichen, mag unmöglich erscheinen, da selbst eine Top-Tier-GPU wie eine RTX 5090 nur über 32 GB VRAM verfügt. Das Geheimnis liegt in der Mixture-of-Experts (MoE)-Architektur des Modells, die Strata genial nutzt. Während das Gesamtmodell 125B Parameter umfasst, sind für jeden Token nur etwa 6 Milliarden aktiv, wobei eine kleine Untergruppe von Experten dynamisch ausgewählt wird.

Strata verteilt die Arbeitslast intelligent auf die Ressourcen Ihres PCs. Gemeinsam genutzte Modellkomponenten und häufig abgerufene Experten befinden sich im VRAM der GPU. Alle 24.576 Experten werden jedoch im System-RAM gespeichert, was einen schnellen Zugriff ermöglicht.

Eine etwa 29 GB große Lookup-Tabelle verbleibt auf der SSD. Strata ruft präventiv kleine, notwendige Zeilen ab, eliminiert E/A-Engpässe und sorgt für einen reibungslosen Betrieb. Diese gestaffelte Speicherstrategie ermöglicht es, ein wirklich massives Modell auf Verbraucher-Hardware auszuführen.

Das Setup des Videos hebt die erforderliche Hardware hervor:

  • Eine RTX 5090 mit 32 GB VRAM
  • Ein Core Ultra 9 285K Prozessor
  • 62 GB RAM
  • Etwa 80 GB freier Festplattenspeicher für die Installation.

Diese Konfiguration zeigt, dass mit optimierter Software wie Strata eine leistungsstarke lokale KI-Inferenz zunehmend zugänglich wird.

Die ‚Türklingel‘ lässt CPU und GPU zusammenarbeiten

Stratas Kerninnovation liegt in der cleveren Orchestrierung heterogener Hardware. Nachdem die GPU die zehn für eine bestimmte Schicht benötigten Experten identifiziert hat, signalisiert sie deren IDs über einen Bereich des gemeinsam genutzten Speichers, der treffend als ‚Türklingel‘ bezeichnet wird. Diese Benachrichtigung ermöglicht es der CPU, gleichzeitig mit der Verarbeitung im System-RAM zu beginnen.

Im Gegensatz zum einfachen Auslagern ganzer Schichten weist Strata dynamisch verfügbare Experten der GPU zu und leitet alle Cache-Misses direkt an die CPU weiter. Dies ermöglicht es beiden Prozessoren, parallel an derselben Schicht zu arbeiten, eliminiert die Leerlaufzeit, die normalerweise mit der Datenbewegung verbunden ist, und sorgt für eine kontinuierliche Berechnung.

Um den Prozess weiter zu beschleunigen, integriert Strata speculative decoding. Ein kleines, effizientes Hilfsmodell schlägt mehrere potenzielle nächste Tokens vor, die das Hauptmodell Qwen 3.8 Flash-Next dann in einem einzigen Batch verifiziert. Dieser Ansatz lieferte in Tests eine berichtete Beschleunigung um das 1,6- bis 1,8-Fache, wobei das Hauptmodell den Vorschlägen des Helfers in etwa 79 % der Fälle zustimmte, ohne das Endergebnis zu verändern.

Dieser einheitliche Ansatz, der GPU-VRAM für aktive Experten, System-RAM für den vollständigen Expertensatz und sogar eine NVMe-SSD für eine massive Nachschlagetabelle nutzt, maximiert den Durchsatz. Weitere technische Details zu diesem Open-Source-Projekt finden Sie unter GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware. Strata verwandelt einen Desktop-PC effektiv in eine leistungsstarke, verteilte Inferenz-Engine.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Schnelle Inferenz ist kein kostenloses Upgrade

Lokale Inferenz bietet überzeugende Vorteile, doch die Geschwindigkeitsergebnisse von Strata sind keine allgemeine Garantie für Modellqualität oder Leistung. Die 2-Bit-lokale Quantisierung von Qwen 3.8 Flash-Next schnitt in den spezifischen Tests des Videos gut ab, was jedoch keine Gleichwertigkeit mit einem Cloud-Modell beweist, das möglicherweise mit höherer Präzision läuft. Präzision beeinflusst oft nuanciertes Schlussfolgern und Faktentreue.

Strata erfordert zudem erhebliche Systemressourcen. Das 125B-Modell kann fast den gesamten verfügbaren VRAM (z. B. 32 GB auf einer RTX 5090) und einen erheblichen Teil des System-RAMs (bis zu 39 GB im Video) beanspruchen. Das erste Laden des Modells kann einen PC für Minuten blockieren, und längere Chats oder unterschiedliche Prompts können den Durchsatz verändern, wie im Video selbst angemerkt wurde.

Diese beeindruckenden Benchmarks sind systemspezifisch. Zum Beispiel ist die 3–5-fache Beschleunigung des Videos auf einer RTX 5090 nicht direkt mit einem Setup mit 12 GB VRAM oder weniger System-RAM vergleichbar.

Letztendlich bietet lokale Inferenz Privatsphäre, Benutzerkontrolle und niedrige Grenzkosten für Strom. Cloud-Dienste hingegen vermeiden die Vorabinvestition in High-End-GPUs und können eine höhere Präzision sowie einen konsistenten Zugriff auf leistungsstarke Modelle bieten. Die Ergebnisse von Strata sind eine überzeugende Demonstration dessen, was mit optimierter Software und Hardware möglich ist, aber kein kostenloses Upgrade für jeden Benutzer.

Häufig gestellte Fragen

Was ist Strata?

Strata ist eine Open-Source-Inferenz-Engine, die darauf ausgelegt ist, Qwen 3.8 Flash-Next lokal auszuführen, indem die Arbeit auf GPU, CPU, System-RAM und SSD verteilt wird.

Wie konnte das lokale Modell im Video die Cloud schlagen?

Auf dem RTX 5090-PC des Erstellers schloss Strata eine lange Antwort in 6,6 Sekunden ab, verglichen mit 33 Sekunden für den Cloud-Lauf. Die Ergebnisse hängen von Prompts, Hardware, Auslastung des Anbieters und Einstellungen ab.

Welchen PC benötigt man, um Strata auszuführen?

Das Video berichtet von einem Minimum von 12 GB VRAM, 32 GB System-RAM und etwa 80 GB freiem Festplattenspeicher. Mehr Arbeitsspeicher und eine schnelle SSD können helfen; das Modell nutzte beträchtliche Mengen an RAM und VRAM.

Ist Strata für jede Aufgabe schneller als Cloud-KI?

Nein. Der Logikrätsel-Test des Videos war im Wesentlichen ein Unentschieden, und die Cloud-Leistung variiert. Das lokale Ergebnis verwendete zudem ein 2-Bit-quantisiertes Modell, daher begründen Geschwindigkeitsvergleiche keine gleiche Genauigkeit.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.