Skip to content
ai tools

xAI's Grok 4.7 ist ein täuschendes Upgrade

Das neueste Modell von xAI wirkt wie eine geringfügige Aktualisierung und enttäuscht Fans, die eine Revolution erwartet hatten. Doch unter der Oberfläche verbergen sich spezialisierte Fortschritte, die einen hohen, unerwarteten Preis haben.

Nora Vance
xAI's Grok 4.7 ist ein täuschendes Upgrade

Größerer Motor, gleiche Geschwindigkeit?

Grok 4.7 landete mit einem enttäuschenden dumpfen Schlag statt mit einem Paukenschlag. Trotz des erheblichen Hypes vor der Veröffentlichung durch Elon Musk tat die Community das neueste Modell von xAI weitgehend als marginale Verbesserung gegenüber Grok 4.6 ab, da es keinen nennenswerten Sprung bei den allgemeinen Schlussfolgerungsfähigkeiten lieferte. Viele Nutzer empfanden das Modell als „enttäuschend“ und verwiesen auf frustrierende Erfahrungen wie „inakzeptabel schlechte“ Frontend-Fähigkeiten, nicht vorhandene 3D-Fähigkeiten und das „Hängenbleiben in zufälligen Gemini-artigen Schleifen“. Es fühlte sich einfach nicht wie ein Frontier-Modell im Vergleich zu Konkurrenten wie GPT-5.6 Sol (max) oder Claude Claude Opus an.

Unter der Haube stellt Grok 4.7 jedoch einen erheblichen architektonischen Sprung dar. Es verfügt über ein neues Basismodell mit 2,1 Billionen Parametern, eine massive Steigerung von 40 % gegenüber den 1,5 Billionen Parametern von Grok 4.6. Dieses größere Fundament durchlief einen längeren, schwierigeren Reinforcement-Learning-Trainingslauf, der speziell auf mehrstündige Aufgaben und eine verbesserte Selbstüberprüfung abzielte. Es integriert außerdem einen völlig neuen, stärkeren Sicherheits-Stack und verbessert die Fähigkeiten für das „Grok Bot harness“.

Diese eklatante Diskrepanz zwischen beeindruckenden zugrunde liegenden Spezifikationen und der wahrgenommenen Leistung unterstreicht einen kritischen Trend: jagged intelligence (unebene Intelligenz). Während Grok 4.7 in bestimmten Bereichen wie der Leistung von Coding-Agenten (Punktzahl 56 im Artificial Analysis Coding Agent Index, gegenüber 47 bei Grok 4.6) und bei agentischer Wissensarbeit über lange Zeiträume hinweg signifikante Zuwächse zeigt, führen diese Verbesserungen nicht zu einer universell intelligenteren, konsistenteren Nutzererfahrung. Tatsächlich deuten einige Tests darauf hin, dass Grok 4.7 in bestimmten Bereichen weniger schlussfolgert als Grok 4.6. Zudem gehen die Gewinne mit höheren Kosten einher, da für einige Aufgaben mehr als doppelt so viele Output-Token im Vergleich zum Vorgänger verbraucht werden.

Die neue Geheimwaffe für Programmierer

Grok 4.7 mag allgemeine Nutzer enttäuschen, aber Programmierer sollten aufhorchen. Trotz verhaltener erster Eindrücke zeichnet sich das neueste Modell von xAI durch agentische Wissensarbeit und Programmieraufgaben aus, die anhaltende Kohärenz erfordern. Es legte im Artificial Analysis Coding Agent Index einen Sprung von 47 auf 56 hin, eine deutliche Steigerung gegenüber der Leistung seines Vorgängers.

Benchmark-Daten bestätigen diese gezielten Erfolge und zeigen, wo Grok 4.7 wirklich glänzt. Es erzielte große Zuwächse bei Terminal-Bench 4.0 und erreichte 38,0 % im Vergleich zu 20,3 % bei Grok 4.6. Darüber hinaus übertraf es starke Konkurrenten wie Claude Fable 5.1 Max beim komplexen DeepSWE v1.1 Benchmark mit 71,0 % gegenüber 65,2 %. Das sind keine marginalen Verbesserungen.

Die Strategie von xAI ist klar: Grok 4.7 als spezialisiertes Entwickler-Arbeitstier zu positionieren. Sie treiben tiefe, unmittelbare Integrationen in die Tools voran, bei denen Programmierer die spezialisierten Fähigkeiten am meisten schätzen und die gezielten Verbesserungen bemerken werden. Sie finden Grok 4.7 in:

  • Cursor
  • Grok Build
  • GitHub Copilot

Diese direkte Integration zielt auf Nutzer ab, die seine neu gewonnenen Stärken nutzen werden, was es zu einem wertvollen, wenn auch nischenorientierten Upgrade für professionelle Entwicklungsumgebungen macht.

Der versteckte Preis von Groks Leistung

Auf dem Papier sieht Grok 4.7 zunächst wie ein wettbewerbsfähiges Preis-Leistungs-Angebot aus. xAI hielt die Standard-API-Preise identisch mit denen des Vorgängers Grok 4.6: 2 $ pro Million Input-Token und 6 $ pro Million Output-Token. Dies entspricht der Preisgestaltung für Modelle wie Claude Claude Opus und scheint Frontier-Level-Fähigkeiten ohne Aufpreis zu bieten.

Hier ist der Haken, und er ist ein großer für Ihren Geldbeutel: Die Verbesserungen von Grok 4.7 haben einen hohen Preis beim Token-Verbrauch. Die Einstellung 'xhigh', die die zuvor besprochene überlegene Leistung freischaltet, verbraucht für identische Aufgaben mehr als doppelt so viele Token wie Grok 4.6. Konkret verbraucht Grok 4.7 (xhigh) etwa 81.000 Output-Token pro Intelligence Index-Aufgabe, während Grok 4.6 (xhigh) nur 38.000 benötigte.

Dieser massive Token-Hunger bedeutet, dass Grok 4.7 eigentlich kein Kostenführer ist. Im praktischen Einsatz übersteigen die Betriebskosten oft sogar die von GPT-6 Astra, was es deutlich teurer macht als seinen Vorgänger. Weitere Details zu den technischen Spezifikationen und der Token-Handhabung finden Sie in den Grok 4.7 | SpaceXAI Docs.

Daher positioniert sich Grok 4.7 nicht als Schnäppchen für den Alltag, sondern als Premium-Tool für spezifische, anspruchsvolle Arbeitsabläufe. Wenn Sie dessen außergewöhnliche agentische Wissensarbeit und Programmierfähigkeiten benötigen, insbesondere bei komplexen, langfristigen Aufgaben, könnten die höheren Kosten gerechtfertigt sein. Andernfalls zahlen Sie deutlich mehr für marginale allgemeine Verbesserungen.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Groks Platz im KI-Wettrüsten

Grok 4.7 hinkt den aktuellen KI-Frontier-Modellen deutlich hinterher. GPT-6 Astra und Claude Fable 5.1 führen bei Benchmarks zur allgemeinen Intelligenz mit Werten von 53 bzw. 51 auf dem Artificial Analysis Intelligence Index. Grok 4.7 erreicht im Vergleich dazu nur einen Wert von 46, was seine aktuelle Position außerhalb der führenden Generalisten-Gruppe unterstreicht.

Elon Musks jüngste Einordnung von Grok 4.7 als in etwa gleichwertig mit Anthropic’s älterem Claude Claude Opus 5.0 signalisiert einen bedeutenden strategischen Wandel für xAI. Diese konservativere Haltung rückt von früheren hyperbolischen Behauptungen ab. Sie verfolgt eine realistische Strategie stetiger, fokussierter Verbesserungen, die gezielt auf agentische Wissensarbeit und Programmierung ausgerichtet sind.

Letztendlich ist Grok 4.7 weder die Revolution, die viele erwartet haben, noch stellt es die allgemeine Intelligenz seiner erstklassigen Konkurrenten in Frage. Es stellt ein strategisch entscheidendes Upgrade dar, das die Position von xAI als leistungsstarker Nischenplayer im Entwickler- und Programmierbereich festigt. Die erheblichen Zuwächse auf dem Artificial Analysis Coding Agent Index, der von 47 auf 56 gestiegen ist, beweisen seinen Wert für gezielte Anwendungen, auch wenn es nicht in die oberste Riege der Generalisten-Modelle vorgestoßen ist.

Häufig gestellte Fragen

Ist Grok 4.7 deutlich besser als Grok 4.6?

Grok 4.7 bietet gezielte Verbesserungen, insbesondere bei Programmier- und agentischen Aufgaben, ist jedoch kein revolutionärer Sprung in der allgemeinen Schlussfolgerungsfähigkeit. Für viele Nutzer mag sich der Leistungssprung trotz des größeren Basismodells inkrementell anfühlen.

Wie schneidet Grok 4.7 im Vergleich zu GPT-6 Astra und Claude Fable 5.1 ab?

Grok 4.7 liegt bei breiten Intelligenz- und Reasoning-Benchmarks hinter GPT-6 Astra und Claude Fable 5.1. Es kann sie jedoch bei spezifischen Programmier-Benchmarks übertreffen, was es eher zu einem spezialisierten Werkzeug als zu einem erstklassigen Generalisten macht.

Ist Grok 4.7 kosteneffizienter als seine Konkurrenten?

Während die Preisgestaltung pro Token wettbewerbsfähig ist, verbraucht Grok 4.7 pro Aufgabe deutlich mehr Token als sein Vorgänger und Konkurrenten wie GPT-6 Astra. Dies kann zu höheren realen Kosten führen, was den offensichtlichen Wert zunichtemacht.

Was sind die Hauptstärken von Grok 4.7?

Seine Hauptstärken liegen in der agentischen Programmierleistung, mit bemerkenswerten Zuwächsen bei Benchmarks wie dem Artificial Analysis Coding Agent Index und DeepSWE. Zudem ist es sofort in Entwicklertools wie Cursor und GitHub Copilot integriert.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.