Olvida GPT-7: Lo que OpenAI realmente lanzó
OpenAI no anunció un nuevo modelo con nombre como "GPT-7". En su lugar, la compañía lanzó una colección sustancial de 722 manuscritos matemáticos, organizados en 372 familias de resultados relacionados. Este lanzamiento, producido por un modelo interno no publicado, aborda directamente cerca de 4,000 problemas de investigación abiertos.
La especulación generalizada sobre "GPT-7" proviene de conjeturas virales, no de una confirmación oficial de OpenAI. OpenAI se refiere constantemente al sistema como un "modelo interno no publicado", enfatizando su estado operativo actual dentro de la compañía en lugar de presentarlo como un producto comercial o un sucesor nombrado de la serie GPT existente.
La escala de este trabajo es importante porque va más allá de los puntos de referencia estándar. El lanzamiento no solo incluye afirmaciones o respuestas sorprendentes de un chatbot, sino también artefactos de respaldo, como pruebas formales verificadas con el Lean theorem prover. Esto permite a investigadores externos validar de forma independiente las afirmaciones matemáticas, marcando un cambio significativo hacia el descubrimiento verificable asistido por máquinas.
Esta colección cubre un amplio espectro de las matemáticas, incluyendo:
- Teoría de números
- Geometría
- Probabilidad
- Ciencias de la computación teórica
- Física matemática
El gasto promedio de cómputo por resultado fue de aproximadamente tres horas de tiempo de pensamiento de ChatGPT Pro, principalmente mediante prompts individuales, un contraste notable con enfoques anteriores más intensivos en recursos que involucraban enjambres masivos de agentes.
Estas eran preguntas de investigación, no tareas escolares
A diferencia de los problemas típicos de tareas con soluciones conocidas, el modelo de OpenAI abordó problemas abiertos: preguntas sin respuestas establecidas, incluso entre expertos. El modelo se involucró con aproximadamente 4,000 de estos problemas, abarcando diversos campos matemáticos.
Estas preguntas de investigación abarcaron:
- Números
- Geometría
- Probabilidad
- Ciencias de la computación
- Física matemática
OpenAI afirma que su lista de 372 familias de resultados no es una clasificación de importancia, sino que refleja la amplitud de las exploraciones de su modelo interno.
Los resultados reportados variaron significativamente. Algunos de los 722 manuscritos reclaman soluciones completas, mientras que otros detallan avances parciales en problemas complejos. Crucialmente, algunos artículos presentan contraejemplos, refutando conjeturas largamente sostenidas y demostrando una comprensión matizada de los límites matemáticos.
Una afirmación particularmente notable, la Familia 003, concierne a la hipótesis de Riemann cuasi-estándar. Esto establece una región libre de ceros para la función zeta de Riemann, específicamente $\zeta(s) \neq 0$ para $\text{Re}(s) > 7/8$. Es vital entender que esta es una afirmación más débil, no una prueba de la hipótesis de Riemann completa, que sigue sin resolverse. Los investigadores han reproducido y verificado de forma independiente este resultado específico utilizando el Lean theorem prover.
Una prueba es más fuerte que una respuesta confiada
La prueba matemática exige un argumento válido que cubra todos los casos posibles, no simplemente un patrón que se mantenga en numerosos ejemplos. Probar una regla en miles de instancias solo revela una tendencia; no prueba la verdad universal de la regla. Un solo contraejemplo puede invalidar una conjetura completa, subrayando el rigor requerido.
OpenAI utilizó Lean, un asistente de pruebas interactivo, para formalizar muchos pasos de las demostraciones. Lean puede verificar estos pasos frente a reglas y suposiciones establecidas, ofreciendo un nivel de certeza que va más allá de la prosa persuasiva. Este artefacto verificado por computadora proporciona una evidencia más sólida, ya que un núcleo automatizado comprueba la consistencia lógica del argumento.
No todos los resultados cuentan con pruebas verificables por computadora, e incluso el trabajo verificado requiere un examen minucioso para asegurar que realmente demuestra la afirmación del manuscrito. El Grupo Asesor sobre Matemáticas e Inteligencia Artificial (AGMAI) fue consultado sobre los estándares de ciencia abierta, pero su participación no implica la verificación de cada resultado. Para más detalles sobre la iniciativa, consulte Sharing AI Progress in Mathematics - OpenAI.
Por ejemplo, una afirmación notable, la quasi-Riemann hypothesis (Familia 003), postula una región libre de ceros para la función zeta de Riemann. Esta versión más débil de la famosa hipótesis ha sido reproducida y verificada de forma independiente por investigadores utilizando el compilador Lean, lo que destaca el poder de la verificación formal para avanzar en la comprensión matemática.
¿Te está gustando? Recibe uno así en tu bandeja cada mañana.
un correo al día · date de baja en dos clics · sin rastreadores de terceros
El verdadero cambio es cómo se pone a prueba la investigación de IA
OpenAI informó que cada resultado exitoso promedió alrededor de tres horas de ChatGPT Pro thinking time de su modelo no lanzado. Esta cifra cuantifica el esfuerzo computacional para ese sistema interno específico para generar un resultado, no es una garantía de que cualquier suscripción de ChatGPT Pro de grado de consumo pueda resolver problemas de investigación abiertos ejecutándose durante tres horas. El número también excluye los extensos pasos de verificación humana y automatizada.
Contraste esto con el proyecto anterior de Navier–Stokes de OpenAI, que involucró aproximadamente a 10,000 agentes de IA trabajando durante 88 horas. Estas dos cifras miden diferentes aspectos de la carga computacional a través de problemas y metodologías distintos; no establecen una aceleración directa o un salto repentino en las capacidades generales del modelo. Diferentes tareas requieren diferentes estrategias computacionales.
Las matemáticas y el código ofrecen campos de prueba inusualmente verificables para el razonamiento de la IA porque las pruebas pueden verificarse algorítmicamente, a menudo con herramientas como Lean. Esto permite un rigor sin precedentes en la evaluación de soluciones generadas por IA. Sin embargo, el éxito en estos dominios estructurados no prueba automáticamente una inteligencia general o un rendimiento confiable en campos menos formales como la ética, las ciencias sociales o la escritura creativa.
La pregunta productiva para la comunidad científica sigue siendo si los matemáticos independientes pueden reproducir, contextualizar y mejorar estos resultados. Este énfasis en la ciencia abierta y verificable contrasta fuertemente con los titulares especulativos sobre "GPT-7" que a menudo dominan el ciclo de noticias, desplazando el enfoque del bombo publicitario al progreso tangible y comprobable.
Preguntas frecuentes
¿Anunció OpenAI un modelo llamado GPT-7?
No. El lanzamiento describe un modelo interno no publicado; GPT-7 es una especulación, no un nombre oficial.
¿Qué produjo el modelo?
OpenAI compartió 722 manuscritos matemáticos agrupados en 372 familias de resultados, basados en trabajos sobre aproximadamente 4,000 problemas de investigación.
¿Resolvió el modelo la hipótesis de Riemann?
No. Un manuscrito afirma un resultado quasi-Riemann más débil; la hipótesis de Riemann completa sigue sin resolverse.
¿Están verificados todos los resultados matemáticos?
No. Algunas pruebas tienen artefactos de Lean verificables por computadora, mientras que otras aún requieren revisión de expertos y pueden contener errores.

