Skip to content
research

Googles Argon: Der stille Königsmacher

Gerade als alle Google abgeschrieben hatten, hat ihr neues KI-Modell alle Rekorde gebrochen. Doch die Benchmarks verbergen einen kritischen Fehler, der seinen Anspruch auf den Thron festigen oder zunichtemachen könnte.

Aki Tanaka
Googles Argon: Der stille Königsmacher

Google stürmt die Bestenliste

Google hat mit der Veröffentlichung von Gemini 4 Argon seine Position an der Spitze der KI-Entwicklung eindrucksvoll zurückerobert. Nachdem Google nach einer Reihe glanzloser Updates einst als 'KI-Dinosaurier' wahrgenommen wurde, hat das Unternehmen die Erwartungen der Branche übertroffen und das Narrativ über Nacht verändert. Argon ist keine schrittweise Iteration, sondern ein völlig neues Frontier-Basismodell, das für tiefgreifendes, komplexes Schlussfolgern in umfangreichen Workflows entwickelt wurde.

Erste Benchmarks zeigen die beeindruckenden Fähigkeiten von Argon. Auf dem kritischen Vals Index, der die wirtschaftlichen Auswirkungen in den Bereichen Finanzen, Programmierung, Recht und Steuern misst, erzielte Argon beeindruckende 68,9 % und übertraf damit Claude Opus 5.5 (67 %) und GPT-6 Astra (63,1 %). Ähnlich verhält es sich bei Software-Engineering-Aufgaben mit langem Zeithorizont: Hier erreichte Argon 77,9 % bei DeepSWE v1.1 und übertraf damit Claude Opus 5.5 (74,2 %) und GPT-6 Astra (74,1 %).

Diese Leistung signalisiert einen bedeutenden Sprung und macht Google wieder zu einem erstklassigen Wettbewerber. Im Gegensatz zu kleineren Modellen der 'Flash-Serie' wie Sonnets oder Haikus repräsentiert Argon Googles "nächste Ära der Frontier-Intelligenz", die darauf ausgelegt ist, komplexe, mehrstufige Probleme mit beispielloser Effizienz und Skalierbarkeit zu lösen. Sein Erscheinen verändert die Wettbewerbslandschaft und setzt neue Maßstäbe für KI-Fähigkeiten.

Der 1M-Token-Game-Changer

Argon definiert Skalierbarkeit mit beispiellosen 1 Million Output-Token neu, ein massiver Sprung gegenüber bisherigen Limits. Diese branchenführende Kapazität ermöglicht es dem Modell, unglaublich lange und umfassende Einzelantworten zu generieren, was für die Bewältigung komplexer, mehrstufiger Workflows und die Problemlösung mit langem Zeithorizont in Bereichen wie Deep Reasoning, Software Engineering und komplexer Wissensarbeit in Unternehmen unerlässlich ist.

Über die reine Ausgabe hinaus senkt Argon die Halluzinationsrate im Vergleich zu früheren Gemini-Modellen von Google und sogar aktuellen Frontier-Wettbewerbern erheblich. Diese verbesserte Zuverlässigkeit macht es zu einem weitaus vertrauenswürdigeren Werkzeug für kritische Anwendungen, von der Analyse juristischer Dokumente bis hin zu Finanzmodellierung und defensiven Cybersicherheitsoperationen. Unternehmen können KI nun mit größerem Vertrauen einsetzen.

Argon beweist seine Fähigkeiten über die Sprache hinaus und zeigt eine hochmoderne Kompetenz im Verständnis der physischen 3D-Welt. Es erreichte den 1. Platz im Blueprint Bench 2, einem anspruchsvollen Benchmark, bei dem KI-Agenten allein anhand von Fotos von Wohnungsinnenräumen präzise Grundrisse zeichnen. Diese einzigartige Stärke deutet stark auf Googles strategische Ambitionen in der Robotik und fortschrittlichen räumlichen KI hin.

Argons Programmierproblem und der Praxistest

Die beeindruckende Dominanz von Argon in Benchmarks steht vor einer entscheidenden Prüfung in der praktischen Anwendung. Trotz der hervorragenden Leistung beim Vals Index und DeepSWE zeigt sich eine deutliche Schwäche bei der Programmierkompetenz. In der Code AI AI Arena Web Dev belegte Argon nur einen abgeschlagenen achten Platz und übertraf Quen 3.8 nur geringfügig. Dies deutet darauf hin, dass Software-Engineering-Generierung, obwohl das Modell bei vielen komplexen Aufgaben versiert ist, außerhalb seiner Frontier-Fähigkeiten liegt, wo Wettbewerber nach wie vor einen entscheidenden Vorsprung haben.

Die Skepsis geht über spezifische Programmier-Benchmarks hinaus. Ein aktueller Bloomberg-Bericht legt nahe, dass selbst interne Google-Mitarbeiter Bedenken hegen und den realen Nutzen von Argon als weniger robust empfinden, als es die gemeldeten Ergebnisse vermuten lassen. Diese Diskrepanz unterstreicht eine anhaltende und bekannte Herausforderung bei der KI-Bewertung: Benchmark-Fitting. Modelle können manchmal bei spezifischen, optimierten Tests glänzen, ohne ihre Intelligenz wirklich auf die nuancierten Anforderungen tatsächlicher Workflows zu übertragen.

Solche Leistungsunterschiede werfen eine kritische Frage auf: Ist Argon eine „KI, die gut im Testen ist“ und akribisch für öffentliche Bestenlisten optimiert wurde, anstatt ein durchweg leistungsfähiges Allzweckwerkzeug für diverse, nicht bewertete Szenarien? Diese Unterscheidung ist entscheidend, um den wahren Umfang seiner Fähigkeiten zu verstehen und Marketingversprechen von nachweisbarer, alltäglicher Wirksamkeit zu trennen. Weitere Einblicke in Googles strategische Ausrichtung für Argon finden Sie unter Gemini 4 Argon: our next era of frontier intelligence - Google Blog.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Preis, Zugang und das endgültige Urteil

Argon tritt mit einer aggressiven Einführungspreisstruktur in den Markt ein, was es angesichts seiner beanspruchten Intelligenz bemerkenswert kosteneffizient macht. Google bietet den API-Zugang für 2 $ pro Million Eingabe-Token und 10 $ pro Million Ausgabe-Token an, was deutlich unter den Preisen vieler Frontier-Modelle liegt. Zwischengespeicherte Eingabe-Token erhalten einen erheblichen Rabatt von 95 %, was die Betriebskosten für iterative Aufgaben weiter senkt. Diese Strategie zielt darauf ab, den Zugang zu fortschrittlichen KI-Fähigkeiten zu demokratisieren.

Google implementiert strategisch eine phasenweise Einführung und gewährt vertrauenswürdigen Cyber-Verteidigern über sein Fairwind-Programm und interne Teams den ersten Zugang. Diese kontrollierte Veröffentlichung signalisiert Googles strengen Sicherheitsüberprüfungsprozess und sein Vertrauen in Argons Fähigkeiten für hochriskante Anwendungen wie die defensive Cybersicherheit. Eine breitere Verfügbarkeit für zahlende API-Kunden und Google AI Ultra-Abonnenten wird folgen, aber Google hat noch kein festes Datum genannt.

Trotz seiner beeindruckenden Dominanz bei Benchmarks und dem branchenführenden Kontextfenster von 1 Million Token stellt Argons mittelmäßige Leistung bei Coding-Benchmarks wie Code AI AI Arena Web Dev eine klare Einschränkung dar. Die zentrale Frage bleibt: Ist Googles Gemini 4 Argon ein echter Paradigmenwechsel, der bereit ist, tägliche Arbeitsabläufe mit seiner Fähigkeit zur Problemlösung über lange Zeiträume hinweg neu zu gestalten, oder ein brillantes, aber nischenhaftes Werkzeug, dessen reale Auswirkungen noch eines endgültigen Beweises bedürfen? Seine spezialisierten Stärken deuten eher auf einen fokussierten Nutzen hin als auf einen sofortigen universellen Ersatz.

Häufig gestellte Fragen

Was ist Googles Gemini 4 Argon?

Gemini 4 Argon ist Googles neues Frontier-KI-Modell, ein völlig neues Basismodell, das für tiefgreifendes logisches Denken bei komplexen Aufgaben entwickelt wurde. Es ist so positioniert, dass es direkt mit Top-Modellen wie OpenAI's GPT-6 Astra und Anthropic's Claude Opus 5.5 konkurriert.

Wie schneidet Gemini 4 Argon im Vergleich zu anderen Modellen wie GPT-6 ab?

Laut den veröffentlichten Benchmarks von Google führt Argon in 13 von 18 Kategorien oder teilt sich den ersten Platz, einschließlich des Vals Index für reale Arbeit und DeepSWE für Software-Engineering. Bei einigen Coding-spezifischen Benchmarks liegt es jedoch zurück.

Was ist das 1-Million-Token-Ausgabelimit?

Dies ist kein Kontextfenster für die Eingabe, sondern ein Limit für die Ausgabe des Modells. Es bedeutet, dass Argon bis zu 1 Million Token (etwa 750.000 Wörter) in einer einzigen Antwort generieren kann, was es ihm ermöglicht, komplexe, mehrstufige Probleme in einem Durchgang zu lösen.

Wann wird Gemini 4 Argon öffentlich verfügbar sein?

Google nutzt eine phasenweise Einführung. Es ist zunächst für vertrauenswürdige Cybersicherheits-Verteidiger im Rahmen ihres Fairwind-Programms verfügbar. Ein breiterer Zugang für zahlende API-Kunden und Google AI Ultra-Abonnenten ist so bald wie möglich geplant, wobei noch kein festes Datum festgelegt wurde.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.