Eine KI hat gerade 10 Tage am Stück programmiert
Alibaba hat gerade die Grenzen autonomer KI-Agenten verschoben. Ihr neues Flaggschiff, Qwen 3.8 Max, ein Open-Weight-Modell mit 2,4 Billionen Parametern, demonstrierte kürzlich eine beispiellose Leistung: Es programmierte über 10 Tage lang ununterbrochen. Ausgestattet mit einem leeren Ordner baute das Modell autonom "O my CLI", einen voll funktionsfähigen Code-Agenten, der jetzt auf GitHub verfügbar ist und seine Fähigkeit zur nachhaltigen, unabhängigen Entwicklung unter Beweis stellt.
Diese bahnbrechende Demo unterstreicht die Kernstärke von Qwen 3.8 Max: agentisches Programmieren. Diese Fähigkeit, die darauf ausgelegt ist, tagelang an einer Aufgabe zu bleiben, ermöglicht es dem Modell, langfristige Projekte zu bewältigen, die komplexe Planung, iterative Ausführung und kontinuierliche Selbstkorrektur ohne ständiges menschliches Eingreifen erfordern. Es zeichnet sich dadurch aus, mehrtägige Programmierherausforderungen zu meistern und nutzt sein 1-Million-Token-Kontextfenster, um die Projektkohärenz aufrechtzuerhalten.
Um die Autonomie weiter zu verbessern, verfügt Qwen 3.8 Max über native multimodale Fähigkeiten. Sein integriertes Bildverarbeitungssystem fungiert als kontinuierliche Feedbackschleife, die es dem Modell ermöglicht, seinen Fortschritt zu "sehen", Ausgaben zu analysieren und seinen Plan dynamisch zu verfeinern. Diese visuelle Einsicht ermöglicht eine ausgefeilte Selbstkorrektur und Anpassung, was für die Bewältigung der iterativen Natur komplexer Softwareentwicklung, vom ersten Konzept bis zur Bereitstellung, entscheidend ist.
Ein Blick in das 2,4-Billionen-Parameter-Monster
Alibabas Qwen 3.8 Max ist eine monumentale Errungenschaft in der Modellarchitektur: ein spärliches Mixture-of-Experts (MoE)-System mit 2,4 Billionen Parametern. Dieses Design aktiviert während der Inferenz geschickt nur etwa 95 Milliarden Parameter pro Token und schafft so ein kritisches Gleichgewicht zwischen roher Rechenleistung und betrieblicher Effizienz. Das Modell verfügt zudem über ein 1-Million-Token-Kontextfenster und multimodale Fähigkeiten, die Bilder, Videos und Text für ein umfassendes Verständnis verarbeiten.
Diese Veröffentlichung stellt einen tiefgreifenden strategischen Wandel für Alibaba dar und markiert das erste Mal, dass sie die Gewichte für ihr leistungsstärkstes Modell der "Max"-Klasse freigegeben haben. Dieser aggressive "Open-Weight"-Schritt signalisiert eine bedeutende Herausforderung für die proprietären KI-Giganten und gestaltet die Wettbewerbslandschaft für hochmoderne agentische Systeme grundlegend um. Es deutet auf eine Zukunft hin, in der erstklassige KI-Fähigkeiten breiter verfügbar werden.
Trotz seiner kolossalen Größe hat Alibaba eine breite Zugänglichkeit sichergestellt. Entwickler können über eine API auf Qwen 3.8 Max zugreifen, mit wettbewerbsfähigen Preisen von 2 USD pro Million Input-Token und 6 USD pro Million Output-Token. Darüber hinaus hat Alibaba für lokale Experimente und Entwicklungen eine kleinere, handlichere Variante mit 27 Milliarden Parametern veröffentlicht, die effizient auf persönlichen Rechnern läuft. Dieser duale Ansatz demokratisiert den Zugang zu fortschrittlichen agentischen KI-Fähigkeiten.
Der Benchmark-Vergleich gegen GPT-5 & Claude
Qwen 3.8 Max programmiert nicht nur autonom; es schneidet im Benchmark-Vergleich wettbewerbsfähig gegenüber führenden Closed-Source-Modellen ab. Bei agentischen Aufgaben glänzt es mit einer Punktzahl von 86,1 bei OSWorld-Verified und übertrifft damit Claude Fable 5 (ca. 85,0) und GPT-5.6 Sol (83,2). Es führt auch bei PaperBench für Forschungsanalysen mit 93,0, vor GPT-5.6 Sol (90,5) und Claude Fable 5 (88,8).
Bei Terminal-Bench 2.1 erreicht Qwen 3.8 Max 86,6 Punkte und übertrifft damit sowohl Claude Opus 4.8 als auch Claude Fable 5 (beide bei 84,6), liegt jedoch hinter GPT-5.6 Sol (88,8). Bei komplexen technischen Aufgaben auf SWE-bench Pro erreicht es jedoch 67,7 Punkte und liegt damit hinter Claude Fable 5 (80,0) und Claude Opus 4.8 (69,2).
Dieses 2,4 Billionen Parameter umfassende System bietet ein leistungsstarkes, ausgewogenes Profil und fordert die langjährige Dominanz von Closed-Source-Modellen von Anthropic und OpenAI direkt heraus. Es zeichnet sich besonders bei agentischen Anwendungsfällen und der Reproduktion von Forschungsergebnissen aus und positioniert sich als robuster Allrounder.
Während die 10-tägige Demo zum Aufbau von 'O my CLI' bahnbrechend war, operierte sie in einer kontrollierten Umgebung – eine entscheidende Nuance für den realen Einsatz. Betrachten Sie die API-Preise: 2 $ pro Million Input-Token und 6 $ pro Million Output-Token. Dieses Open-Weight-Modell kann tagelang laufen und bietet eine überzeugende, kostenbewusste Alternative in der sich entwickelnden KI-Landschaft.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Ist dies das Ende der Closed-Source-Dominanz?
Die Veröffentlichung von Qwen 3.8 Max durch Alibaba verändert die globale KI-Machtdynamik grundlegend. Ein erstklassiges MoE-Modell mit 2,4 Billionen Parametern aus China, das nun mit offenen Gewichten verfügbar ist, fordert die etablierte Closed-Source-Dominanz westlicher Tech-Giganten direkt heraus. Dies intensiviert den weltweiten Wettlauf um die Entwicklung und Verbreitung von Frontier-KI und schafft eine diversifiziertere Wettbewerbslandschaft.
Entscheidend ist, dass "Open-Weight" nicht mit vollständig "Open-Source" gleichzusetzen ist. Alibaba gewährt Zugriff auf die Modellparameter und ermöglicht so breite Experimente und Entwicklungen. Zukünftige Lizenzbeschränkungen könnten jedoch weiterhin den kommerziellen Einsatz regeln und die wahren Grenzen der Zugänglichkeit für Unternehmensanwendungen definieren.
Für die breitere Industrie demokratisiert dies den Zugang zu hochleistungsfähiger agentischer KI. Entwickler erhalten ein mächtiges neues Werkzeug, das für mehrtägiges autonomes Programmieren konzipiert ist und Innovationszyklen drastisch beschleunigen könnte. Dennoch wirft die weitreichende Einführung solch potenter Modelle aus unterschiedlichen geopolitischen Ursprüngen neue Fragen zu kommerzieller Nutzung, Daten-Governance und ethischen Einsatzstandards weltweit auf. Die Grenze der KI-Entwicklung fühlt sich nun deutlich offener und komplexer an.
Häufig gestellte Fragen
Was ist Qwen 3.8 Max?
Qwen 3.8 Max ist ein Open-Weight-KI-Modell von Alibaba mit 2,4 Billionen Parametern, das speziell für langwierige, autonome Aufgaben wie agentisches Programmieren entwickelt wurde.
Kann ich Qwen 3.8 Max auf meinem Laptop ausführen?
Nein, das Modell mit 2,4 Billionen Parametern erfordert erhebliche Rechenressourcen. Alibaba hat jedoch auch eine Variante mit 27 Milliarden Parametern veröffentlicht, Qwen 3.8-27B, die für die Ausführung auf persönlichen Rechnern konzipiert ist.
Wie schneidet Qwen 3.8 Max im Vergleich zu Modellen wie GPT oder Claude ab?
Es ist äußerst wettbewerbsfähig. Qwen 3.8 Max übertrifft Modelle wie Claude Fable 5 und GPT-5.6 Sol bei Benchmarks für agentische Computernutzung (OSWorld-Verified), liegt jedoch bei einigen komplexen Software-Engineering-Tests (SWE-bench Pro) zurück.
Was hat Qwen 3.8 Max in seiner 10-tägigen Demo erstellt?
In seiner beeindruckendsten Demonstration erhielt das Modell einen leeren Ordner und erstellte über 10 Tage hinweg autonom 'O my CLI', einen vollständigen, funktionierenden Code-Agenten, der jetzt auf GitHub verfügbar ist.

