Skip to content
research

Argon do Google: O Rei Silencioso

Justo quando todos descartaram o Google, seu novo modelo de IA quebrou todos os recordes. Mas os benchmarks escondem uma falha crítica que pode definir o sucesso ou o fracasso de sua reivindicação ao trono.

Aki Tanaka
Argon do Google: O Rei Silencioso

Google domina o ranking

O Google reafirmou drasticamente sua posição na vanguarda do desenvolvimento de IA com o lançamento do Gemini 4 Argon. Antes visto como um 'dinossauro da IA' após uma série de atualizações sem brilho, o Google superou as expectativas da indústria, mudando a narrativa da noite para o dia. O Argon não é uma iteração incremental, mas um modelo de base de fronteira totalmente novo, projetado para raciocínio profundo e complexo em fluxos de trabalho extensos.

Os benchmarks iniciais revelam as capacidades impressionantes do Argon. No crítico Vals Index, que mede o impacto econômico em finanças, programação, jurídico e tributário, o Argon obteve impressionantes 68,9%, superando o Claude Opus 5.5 (67%) e o GPT-6 Astra (63,1%). Da mesma forma, para tarefas de engenharia de software de longo prazo, o Argon alcançou 77,9% no DeepSWE v1.1, superando o Claude Opus 5.5 (74,2%) e o GPT-6 Astra (74,1%).

Este desempenho sinaliza um salto significativo, colocando o Google firmemente de volta como um concorrente de alto nível. Ao contrário dos modelos menores da 'Flash series', como sonnets ou haikus, o Argon representa a "próxima era da inteligência de fronteira" do Google, projetada para resolver problemas complexos e de várias etapas com eficácia e escala sem precedentes. Seu surgimento remodela o cenário competitivo, estabelecendo um novo padrão para as capacidades de IA.

O divisor de águas de 1M de tokens

O Argon redefine a escala com um número sem precedentes de 1 milhão de tokens de saída, um salto enorme em relação aos limites anteriores. Essa capacidade líder do setor permite que o modelo gere respostas únicas incrivelmente longas e abrangentes, essenciais para lidar com fluxos de trabalho complexos de várias etapas e resolução de problemas de longo prazo em áreas como raciocínio profundo, engenharia de software e trabalho complexo de conhecimento empresarial.

Além da produção pura, o Argon reduz significativamente a taxa de alucinação em comparação com os modelos anteriores do Gemini do Google e até mesmo com os atuais concorrentes de fronteira. Essa confiabilidade aprimorada o torna uma ferramenta muito mais confiável para aplicações críticas, desde a análise de documentos jurídicos até a modelagem financeira e operações de cibersegurança defensiva. As empresas agora podem implementar IA com maior confiança.

Demonstrando proeza além da linguagem, o Argon exibe uma capacidade de ponta na compreensão do mundo físico 3D. Ele alcançou o 1º lugar no Blueprint Bench 2, um benchmark desafiador onde agentes de IA desenham plantas baixas com precisão apenas a partir de fotografias de interiores de apartamentos. Essa força única sugere fortemente as ambições estratégicas do Google em robótica e IA espacial avançada.

O problema de codificação do Argon e o teste no mundo real

O domínio impressionante do Argon nos benchmarks enfrenta um teste crucial na aplicação prática. Apesar de seu desempenho estelar no Vals Index e no DeepSWE, uma fraqueza significativa surge na proficiência em codificação. No Code AI AI Arena Web Dev, o Argon ficou em um distante oitavo lugar, superando apenas marginalmente o Quen 3.8. Isso sugere que, embora seja adepto de muitas tarefas complexas, a geração de engenharia de software permanece fora de suas capacidades de fronteira, onde os concorrentes ainda mantêm uma vantagem decisiva.

O ceticismo vai além de benchmarks de codificação específicos. Um relatório recente da Bloomberg sugere que até mesmo os funcionários internos do Google têm preocupações, achando a utilidade do Argon no mundo real menos robusta do que suas pontuações relatadas. Essa discrepância destaca um desafio persistente e bem conhecido na avaliação de IA: o benchmark-fitting. Os modelos às vezes podem se destacar em testes específicos e otimizados sem realmente generalizar sua inteligência para as demandas diferenciadas dos fluxos de trabalho reais.

Tais disparidades de desempenho levantam uma questão crítica: o Argon é uma "IA boa em fazer testes", meticulosamente otimizada para rankings públicos, em vez de uma ferramenta de uso geral consistentemente poderosa em diversos cenários não avaliados? Essa distinção é vital para entender o verdadeiro alcance de suas capacidades e separar as alegações de marketing da eficácia demonstrável no dia a dia. Mais informações sobre a direção estratégica do Google para o Argon estão disponíveis em Gemini 4 Argon: our next era of frontier intelligence - Google Blog.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

Preço, Acesso e o Veredito Final

O Argon entra no mercado com uma estrutura de preços introdutória agressiva, tornando-o notavelmente eficiente em termos de custo para a inteligência que alega ter. O Google oferece acesso à API por US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, superando significativamente muitos modelos de fronteira. Tokens de entrada em cache recebem um desconto substancial de 95%, reduzindo ainda mais os custos operacionais para tarefas iterativas. Essa estratégia visa democratizar o acesso a capacidades avançadas de IA.

O Google implementa estrategicamente um lançamento gradual, concedendo acesso inicial exclusivamente a cyber defenders de confiança por meio de seu Fairwind Program e equipes internas. Esse lançamento controlado sinaliza o rigoroso processo de verificação de segurança do Google e sua confiança nas capacidades do Argon para aplicações de alto risco, como cibersegurança defensiva. Uma disponibilidade mais ampla para clientes pagantes da API e assinantes do Google AI Ultra virá a seguir, mas o Google não especificou uma data definitiva.

Apesar de seu domínio impressionante em benchmarks e sua janela de contexto de 1 milhão de tokens, líder do setor, o desempenho mediano do Argon em benchmarks de codificação como o Code AI AI Arena Web Dev apresenta uma limitação clara. A questão central permanece: o Gemini 4 Argon do Google é uma verdadeira mudança de paradigma, pronta para remodelar fluxos de trabalho diários com sua proeza de resolução de problemas de longo prazo, ou uma ferramenta brilhante, porém de nicho, cujo impacto no mundo real ainda aguarda prova definitiva? Seus pontos fortes especializados sugerem uma utilidade focada, em vez de uma substituição universal imediata.

Perguntas Frequentes

O que é o Gemini 4 Argon do Google?

O Gemini 4 Argon é o novo modelo de IA de fronteira do Google, um modelo base completamente novo projetado para raciocínio profundo em tarefas complexas. Ele está posicionado para competir diretamente com os principais modelos, como o GPT-6 Astra da OpenAI e o Claude Opus 5.5 da Anthropic.

Como o Gemini 4 Argon se compara a outros modelos como o GPT-6?

De acordo com os benchmarks publicados pelo Google, o Argon lidera ou empata com a pontuação mais alta em 13 das 18 categorias, incluindo o Vals Index para trabalho no mundo real e o DeepSWE para engenharia de software. No entanto, ele fica atrás em alguns benchmarks específicos de codificação.

O que é o limite de saída de 1 milhão de tokens?

Esta não é uma janela de contexto para entrada, mas um limite para a saída do modelo. Isso significa que o Argon pode gerar até 1 milhão de tokens (aproximadamente 750.000 palavras) em uma única resposta, permitindo que ele resolva problemas complexos de várias etapas de uma só vez.

Quando o Gemini 4 Argon estará disponível publicamente?

O Google está usando um lançamento gradual. Ele está inicialmente disponível para defensores de cibersegurança de confiança em seu Fairwind Program, com acesso mais amplo para clientes pagantes da API e assinantes do Google AI Ultra planejado para seguir o mais rápido possível, sem uma data definida.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.