Esqueça o GPT-7: O que a OpenAI realmente lançou
A OpenAI não anunciou um novo modelo nomeado como "GPT-7". Em vez disso, a empresa lançou uma coleção substancial de 722 manuscritos matemáticos, organizados em 372 famílias de resultados relacionados. Este lançamento, produzido por um modelo interno não lançado, aborda diretamente cerca de 4.000 problemas de pesquisa em aberto.
A especulação generalizada sobre o "GPT-7" origina-se de palpites virais, não de uma confirmação oficial da OpenAI. A OpenAI refere-se consistentemente ao sistema como um "modelo interno não lançado", enfatizando seu status operacional atual dentro da empresa, em vez de um produto comercial ou um sucessor nomeado da série GPT existente.
A escala deste trabalho é importante porque vai além dos benchmarks padrão. O lançamento inclui não apenas alegações ou respostas impressionantes de chatbot, mas também artefatos de suporte, como provas formais verificadas com o Lean theorem prover. Isso permite que pesquisadores externos validem independentemente as alegações matemáticas, marcando uma mudança significativa em direção à descoberta verificável assistida por máquina.
Esta coleção cobre um amplo espectro da matemática, incluindo:
- Teoria dos números
- Geometria
- Probabilidade
- Ciência da computação teórica
- Física matemática
O gasto computacional médio por resultado foi de aproximadamente três horas de tempo de raciocínio do ChatGPT Pro, principalmente via prompts únicos, um contraste notável com abordagens anteriores que consumiam mais recursos e envolviam grandes enxames de agentes.
Estas eram questões de pesquisa, não dever de casa
Ao contrário dos problemas típicos de dever de casa com soluções conhecidas, o modelo da OpenAI abordou problemas em aberto: questões sem respostas estabelecidas, mesmo entre especialistas. O modelo envolveu-se com cerca de 4.000 desses problemas, abrangendo diversos campos matemáticos.
Estas questões de pesquisa abrangeram:
- Números
- Geometria
- Probabilidade
- Ciência da computação
- Física matemática
A OpenAI afirma que sua lista de 372 famílias de resultados não é um ranking de importância, refletindo a amplitude das explorações de seu modelo interno.
Os resultados relatados variaram significativamente. Alguns dos 722 manuscritos reivindicam soluções completas, enquanto outros detalham progressos parciais em problemas complexos. Crucialmente, alguns artigos apresentam contraexemplos, refutando conjecturas de longa data e demonstrando uma compreensão sutil dos limites matemáticos.
Uma alegação particularmente notável, a Família 003, diz respeito à hipótese de quase-Riemann. Isso estabelece uma região livre de zeros para a função zeta de Riemann, especificamente $\zeta(s) \neq 0$ para $\text{Re}(s) > 7/8$. É vital entender que esta é uma alegação mais fraca, não uma prova da hipótese de Riemann completa, que permanece sem solução. Pesquisadores reproduziram e verificaram independentemente este resultado específico usando o Lean theorem prover.
Uma prova é mais forte do que uma resposta confiante
A prova matemática exige um argumento válido que cubra todos os casos possíveis, não simplesmente um padrão que se sustente em numerosos exemplos. Testar uma regra em milhares de instâncias apenas revela uma tendência; não prova a verdade universal da regra. Um único contraexemplo pode invalidar uma conjectura inteira, ressaltando o rigor necessário.
A OpenAI utilizou o Lean, um provador de teoremas interativo, para formalizar muitas etapas de prova. O Lean pode verificar essas etapas em relação a regras e suposições estabelecidas, oferecendo um nível de certeza que vai além da prosa persuasiva. Este artefato verificado por computador fornece evidências mais fortes, já que um kernel automatizado valida a consistência lógica do argumento.
Nem todos os resultados possuem provas verificáveis por computador, e mesmo o trabalho verificado requer escrutínio para garantir que ele realmente comprove a afirmação no manuscrito. O Advisory Group on Mathematics and Artificial Intelligence (AGMAI) foi consultado sobre padrões de ciência aberta, mas seu envolvimento não implica a verificação de cada resultado. Para mais detalhes sobre a iniciativa, consulte Sharing AI Progress in Mathematics - OpenAI.
Por exemplo, uma afirmação notável, a quasi-Riemann hypothesis (Família 003), postula uma região livre de zeros para a função zeta de Riemann. Esta versão mais fraca da famosa hipótese foi reproduzida e verificada de forma independente por pesquisadores usando o compilador Lean, destacando o poder da verificação formal no avanço da compreensão matemática.
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
A Verdadeira Mudança é Como a Pesquisa em IA é Testada
A OpenAI relatou que cada resultado bem-sucedido levou, em média, cerca de três horas de ChatGPT Pro thinking time do seu modelo não lançado. Este número quantifica o esforço computacional para aquele sistema interno específico gerar um resultado, não sendo uma garantia de que qualquer assinatura do ChatGPT Pro de nível consumidor possa resolver problemas de pesquisa em aberto rodando por três horas. O número também exclui as extensas etapas de verificação humana e automatizada.
Compare isso com o projeto anterior da OpenAI, Navier–Stokes, que envolveu cerca de 10.000 agentes de IA trabalhando por 88 horas. Esses dois números medem aspectos diferentes da carga computacional em problemas e metodologias distintos; eles não estabelecem uma aceleração direta ou um salto repentino nas capacidades gerais do modelo. Tarefas diferentes exigem estratégias computacionais diferentes.
A matemática e o código oferecem campos de teste excepcionalmente verificáveis para o raciocínio da IA, porque as provas podem ser checadas algoritmicamente, frequentemente com ferramentas como o Lean. Isso permite um rigor sem precedentes na avaliação de soluções geradas por IA. No entanto, o sucesso nesses domínios estruturados não prova automaticamente inteligência geral ou desempenho confiável em campos menos formais, como ética, ciências sociais ou escrita criativa.
A questão produtiva para a comunidade científica continua sendo se matemáticos independentes podem reproduzir, contextualizar e melhorar esses resultados. Essa ênfase na ciência aberta e verificável contrasta fortemente com as manchetes especulativas sobre o "GPT-7" que frequentemente dominam o ciclo de notícias, mudando o foco do hype para um progresso tangível e testável.
Perguntas Frequentes
A OpenAI anunciou um modelo chamado GPT-7?
Não. O lançamento descreve um modelo interno não lançado; GPT-7 é especulação, não um nome oficial.
O que o modelo produziu?
A OpenAI compartilhou 722 manuscritos matemáticos agrupados em 372 famílias de resultados, baseados em trabalhos sobre aproximadamente 4.000 problemas de pesquisa.
O modelo resolveu a hipótese de Riemann?
Não. Um manuscrito alega um resultado quasi-Riemann mais fraco; a hipótese de Riemann completa permanece sem solução.
Todos os resultados matemáticos estão verificados?
Não. Algumas provas possuem artefatos Lean verificáveis por computador, enquanto outras ainda requerem revisão de especialistas e podem conter erros.

