Skip to content
research

OpenAIs geheimes Mathe-Modell ist eine größere Sache als GPT-7

Ein virales Label eilt den Beweisen voraus, während Mathematiker vor einer folgenschwereren Frage stehen: Wie sollten KI-generierte Entdeckungen überprüft werden? Die Antwort könnte die Forschung lange bevor sich jemand auf einen Modellnamen einigt, grundlegend verändern.

Aki Tanaka
OpenAIs geheimes Mathe-Modell ist eine größere Sache als GPT-7

Vergessen Sie GPT-7: Was OpenAI tatsächlich veröffentlicht hat

OpenAI hat kein neues Modell mit einem Namen wie „GPT-7“ angekündigt. Stattdessen veröffentlichte das Unternehmen eine umfangreiche Sammlung von 722 mathematischen Manuskripten, die in 372 Familien verwandter Ergebnisse unterteilt sind. Diese Veröffentlichung, die von einem unveröffentlichten internen Modell erstellt wurde, befasst sich direkt mit etwa 4.000 offenen Forschungsproblemen.

Die weit verbreiteten „GPT-7“-Spekulationen stammen aus viralen Vermutungen, nicht aus offiziellen Bestätigungen von OpenAI. OpenAI bezeichnet das System konsequent als „unveröffentlichtes internes Modell“ und betont damit dessen aktuellen operativen Status innerhalb des Unternehmens, anstatt es als kommerzielles Produkt oder benannten Nachfolger der bestehenden GPT-Serie zu vermarkten.

Das Ausmaß dieser Arbeit ist von Bedeutung, da sie über Standard-Benchmarks hinausgeht. Die Veröffentlichung enthält nicht nur Behauptungen oder beeindruckende Chatbot-Antworten, sondern auch unterstützende Artefakte wie formale Beweise, die mit dem Lean Theorem Prover verifiziert wurden. Dies ermöglicht es externen Forschern, die mathematischen Behauptungen unabhängig zu validieren, was einen bedeutenden Wandel hin zu verifizierbaren, maschinengestützten Entdeckungen markiert.

Diese Sammlung deckt ein breites Spektrum der Mathematik ab, darunter:

  • Zahlentheorie
  • Geometrie
  • Wahrscheinlichkeitstheorie
  • Theoretische Informatik
  • Mathematische Physik

Der durchschnittliche Rechenaufwand pro Ergebnis betrug etwa drei Stunden ChatGPT Pro-Denkzeit, hauptsächlich über einzelne Prompts, ein bemerkenswerter Kontrast zu früheren, ressourcenintensiveren Ansätzen mit massiven Agenten-Schwärmen.

Das waren Forschungsfragen, keine Hausaufgaben

Im Gegensatz zu typischen Hausaufgaben mit bekannten Lösungen befasste sich das Modell von OpenAI mit offenen Problemen: Fragen ohne etablierte Antworten, selbst unter Experten. Das Modell beschäftigte sich mit etwa 4.000 solcher Probleme aus verschiedenen mathematischen Bereichen.

Diese Forschungsfragen umfassten:

  • Zahlen
  • Geometrie
  • Wahrscheinlichkeit
  • Informatik
  • Mathematische Physik

OpenAI gibt an, dass seine Liste der 372 Ergebnisfamilien keine Rangliste der Wichtigkeit darstellt, sondern die Breite der Erkundungen seines internen Modells widerspiegelt.

Die berichteten Ergebnisse variierten erheblich. Einige der 722 Manuskripte beanspruchen vollständige Lösungen, während andere Teilfortschritte bei komplexen Problemen detailliert beschreiben. Entscheidend ist, dass einige Arbeiten Gegenbeispiele präsentieren, die lang gehegte Vermutungen widerlegen und ein nuanciertes Verständnis mathematischer Grenzen demonstrieren.

Eine besonders bemerkenswerte Behauptung, Familie 003, betrifft die quasi-Riemannsche Vermutung. Dies etabliert einen nullstellenfreien Bereich für die Riemannsche Zeta-Funktion, spezifisch $\zeta(s) \neq 0$ für $\text{Re}(s) > 7/8$. Es ist wichtig zu verstehen, dass dies eine schwächere Behauptung ist und kein Beweis der vollständigen Riemannschen Vermutung, die weiterhin ungelöst bleibt. Forscher haben dieses spezifische Ergebnis mithilfe des Lean Theorem Prover unabhängig reproduziert und verifiziert.

Ein Beweis ist stärker als eine selbstbewusste Antwort

Ein mathematischer Beweis erfordert ein gültiges Argument, das jeden möglichen Fall abdeckt, nicht einfach ein Muster, das über zahlreiche Beispiele hinweg Bestand hat. Das Testen einer Regel an Tausenden von Instanzen offenbart nur einen Trend; es beweist nicht die universelle Wahrheit der Regel. Ein einziges Gegenbeispiel kann eine ganze Vermutung entkräften, was die erforderliche Strenge unterstreicht.

OpenAI nutzte Lean, einen interaktiven Theorembeweiser, um viele Beweisschritte zu formalisieren. Lean kann diese Schritte anhand festgelegter Regeln und Annahmen überprüfen und bietet ein Maß an Gewissheit, das über überzeugende Prosa hinausgeht. Dieses computergeprüfte Artefakt liefert stärkere Beweise, da ein automatisierter Kernel die logische Konsistenz des Arguments verifiziert.

Nicht alle Ergebnisse verfügen über computerprüfbare Beweise, und selbst verifizierte Arbeiten erfordern eine genaue Prüfung, um sicherzustellen, dass sie die Behauptung im Manuskript tatsächlich belegen. Die Advisory Group on Mathematics and Artificial Intelligence (AGMAI) beriet zu Open-Science-Standards, aber ihre Beteiligung impliziert nicht die Verifizierung jedes einzelnen Ergebnisses. Weitere Einzelheiten zur Initiative finden Sie unter Sharing AI Progress in Mathematics - OpenAI.

Ein bemerkenswerter Anspruch, die quasi-Riemann hypothesis (Familie 003), postuliert beispielsweise einen nullstellenfreien Bereich für die Riemannsche Zeta-Funktion. Diese schwächere Version der berühmten Hypothese wurde von Forschern unter Verwendung des Lean-Compilers unabhängig reproduziert und verifiziert, was die Leistungsfähigkeit der formalen Verifizierung für den Fortschritt des mathematischen Verständnisses unterstreicht.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Die eigentliche Veränderung liegt darin, wie KI-Forschung getestet wird

OpenAI berichtete, dass jedes erfolgreiche Ergebnis durchschnittlich etwa drei Stunden ChatGPT Pro thinking time seines unveröffentlichten Modells in Anspruch nahm. Diese Zahl quantifiziert den Rechenaufwand für dieses spezifische interne System, um ein Ergebnis zu generieren, und ist keine Garantie dafür, dass jedes handelsübliche ChatGPT Pro-Abonnement offene Forschungsprobleme durch dreistündige Laufzeit lösen kann. Die Zahl schließt zudem die umfangreichen menschlichen und automatisierten Verifizierungsschritte aus.

Vergleichen Sie dies mit dem früheren Navier–Stokes-Projekt von OpenAI, bei dem etwa 10.000 KI-Agenten 88 Stunden lang arbeiteten. Diese beiden Zahlen messen unterschiedliche Aspekte der Rechenlast bei verschiedenen Problemen und Methoden; sie stellen keine direkte Beschleunigung oder einen plötzlichen Sprung in den allgemeinen Modellfähigkeiten dar. Unterschiedliche Aufgaben erfordern unterschiedliche Rechenstrategien.

Mathematik und Code bieten ungewöhnlich verifizierbare Testumgebungen für KI-Schlussfolgerungen, da Beweise algorithmisch überprüft werden können, oft mit Tools wie Lean. Dies ermöglicht eine beispiellose Genauigkeit bei der Bewertung von KI-generierten Lösungen. Der Erfolg in diesen strukturierten Bereichen beweist jedoch nicht automatisch eine allgemeine Intelligenz oder eine zuverlässige Leistung in weniger formalen Bereichen wie Ethik, Sozialwissenschaften oder kreativem Schreiben.

Die produktive Frage für die wissenschaftliche Gemeinschaft bleibt, ob unabhängige Mathematiker diese Ergebnisse reproduzieren, kontextualisieren und verbessern können. Dieser Fokus auf verifizierbare, offene Wissenschaft steht in krassem Gegensatz zu den spekulativen „GPT-7“-Schlagzeilen, die oft den Nachrichtenzyklus dominieren, und verlagert den Schwerpunkt von Hype auf greifbaren, testbaren Fortschritt.

Häufig gestellte Fragen

Hat OpenAI ein Modell namens GPT-7 angekündigt?

Nein. Die Veröffentlichung beschreibt ein unveröffentlichtes internes Modell; GPT-7 ist Spekulation, kein offizieller Name.

Was hat das Modell produziert?

OpenAI teilte 722 mathematische Manuskripte, gruppiert in 372 Ergebnisfamilien, basierend auf Arbeiten zu etwa 4.000 Forschungsproblemen.

Hat das Modell die Riemannsche Vermutung gelöst?

Nein. Ein Manuskript behauptet ein schwächeres, quasi-Riemannsches Ergebnis; die vollständige Riemannsche Vermutung bleibt ungelöst.

Sind alle mathematischen Ergebnisse verifiziert?

Nein. Einige Beweise haben computerprüfbare Lean-Artefakte, während andere noch eine Expertenprüfung erfordern und Fehler enthalten können.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.