Skip to content
industry insights

O cérebro do DeepSeek acabou de derreter

O modelo mais recente do DeepSeek está destruindo benchmarks e desafiando gigantes como o GPT-5.6. Mas um simples quebra-cabeça 3D revela uma falha crítica que questiona o que 'compreensão visual' realmente significa para a IA.

Cassidy Wolfe
O cérebro do DeepSeek acabou de derreter

O destruidor de benchmarks que não consegue ver um cubo

DeepSeek V4.1 flash surgiu em 10 de setembro de 2026, um modelo multimodal Mixture-of-Experts (MoE) ostentando uma espinha dorsal de 552B e uma impressionante janela de contexto de 1M de tokens. Com 8B de parâmetros ativos para entrada e 16B para saída, este desafiante licenciado pelo MIT, com preço competitivo de US$ 0,003 por milhão de tokens de entrada em cache, não era apenas mais um participante. Ele declarou guerra aos campeões reinantes, supostamente superando o GPT-5.6 Sol da OpenAI e o Claude Opus-5.0 da Anthropic em benchmarks agenticos críticos, pronto para redefinir a codificação agentica, o raciocínio e a compreensão visual.

Então veio Matthew Berman, armado com um cubo mágico simulado e o harness do Codex. Seu teste viral visava validar o aclamado raciocínio visual e espacial do DeepSeek V4.1 flash. A tarefa era simples: resolver o cubo, uma implicação profunda para um modelo que afirma ter "compreensão nativa de imagem" e inteligência superior.

O que se desenrolou não foi uma demonstração de IA avançada, mas um colapso espetacular. O DeepSeek V4.1 flash não apenas falhou em resolver o cubo mágico; ele não conseguiu nem compreender sua natureza fundamental. O vídeo de Berman mostrou cada quadrado flutuando independentemente, desconectado do todo, com cores mudando inexplicavelmente sem qualquer movimento físico. O modelo, apesar dessa exibição de "trapaça" de realidade mutável, permaneceu completamente perplexo, incapaz de perceber um objeto sólido ou suas relações espaciais inerentes.

Quando a 'Compreensão Visual' não é suficiente

O DeepSeek V4.1 flash, alardeado por sua "compreensão nativa de imagem" e contexto de 1M de tokens, acabou de fracassar espetacularmente em um simples cubo mágico. O vídeo "DeepSeek Fails the Rubik’s Cube Test" de Matthew Berman expôs brutalmente uma desconexão crítica: o modelo não consegue compreender objetos 3D dinâmicos. Isso não é apenas um bug; é uma lacuna fundamental em suas capacidades visuais ostentadas.

Rodando no harness do Codex, o modelo V4.1 flash representou o cubo de forma totalmente errada. Os quadrados "flutuavam independentemente" em vez de se conectarem, e os lados mudavam de cor sem rotação física. O sistema "trapaceou" alterando as cores diretamente, mas ainda assim falhou em resolver o quebra-cabeça, demonstrando uma incapacidade profunda de manter um modelo espacial coerente e persistente.

Reconhecer um objeto estático, como "isto é um cubo", é uma coisa; manipular sua física em um ambiente dinâmico exige uma arquitetura cognitiva completamente diferente. Isso requer uma representação interna persistente de relações, gravidade e movimento. O desempenho do DeepSeek V4.1 flash sugere que ele carece desse raciocínio 3D crucial, reduzindo interações complexas a eventos visuais desconectados.

Isso não é uma anomalia para o DeepSeek. Iterações anteriores também lutaram com renderização espacial intrincada e movimento preciso de eixos em outros testes. A falha no cubo mágico ressalta um calcanhar de Aquiles recorrente, sugerindo que as impressionantes pontuações de benchmark do DeepSeek podem mascarar um problema mais profundo e não resolvido em sua compreensão fundamental do espaço físico.

O Cubo Mágico: Um soro da verdade para a IA

Os cubos mágicos há muito servem como o teste de fogo definitivo da IA, um desafio enganosamente simples que exige inteligência profunda. O DeepCubeA da Google DeepMind, por exemplo, resolveu famosamente o cubo em uma média de 20 movimentos em 2019, demonstrando que uma IA especializada pode dominar essa tarefa. Este não é um problema novo para a IA; é um problema resolvido.

Além da simples resolução de quebra-cabeças, o cubo mede criticamente a capacidade de um modelo em:

  • Raciocínio espacial: compreensão da manipulação de objetos 3D.
  • Manutenção de estado: rastreamento da configuração em constante mudança do cubo.
  • Planejamento lógico: elaboração de estratégias para soluções de várias etapas.

Isso exige a internalização das regras físicas de um objeto, não apenas o reconhecimento de pixels ou padrões.

O DeepSeek V4.1 flash, um modelo que ostenta 1M de contexto e vitórias competitivas contra o GPT-5.6 Sol da OpenAI e o Claude Opus-5.0 da Anthropic em benchmarks de agentes, desmoronou sob este escrutínio básico. Sua falha observada — onde quadrados flutuavam independentemente e cores mudavam sem movimento — expõe uma desconexão profunda em sua "compreensão nativa de imagem". O cubo de Rubik atua como um soro da verdade implacável, removendo a bravata dos benchmarks para revelar a verdadeira compreensão de um modelo sobre o mundo físico. Para mais informações sobre seus modelos avançados, veja DeepSeek | Into the Unknown.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

Além dos Benchmarks: A Busca pelo Fundamento Físico

Benchmarks, mesmo os de agentes avançados como o DeepSWE v1.1 ou o CyberGym, frequentemente perdem pontos cegos críticos. O DeepSeek V4.1 flash supostamente supera o GPT-5.6 Sol e o Claude Opus-5.0 nestes, mas falha em um cubo de Rubik simulado, demonstrando uma desconexão profunda entre o desempenho em tarefas abstratas e a realidade física fundamental. Os quadrados do modelo flutuavam independentemente, as cores mudavam sem movimento – uma clara alucinação da física, não apenas uma falha em resolver.

Isso destaca o imenso desafio do fundamento físico. Um modelo pode possuir vasto conhecimento abstrato e "compreensão nativa de imagem", mas sem um modelo interno coerente de causa e efeito em um espaço 3D, sua inteligência permanece frágil. O DeepSeek V4.1 flash, apesar de seu contexto de 1M de tokens e capacidades multimodais, não conseguiu conectar sua entrada visual às regras concretas e persistentes de um objeto simples.

Para que a IA avance verdadeiramente além de texto e imagens estáticas para robótica, simulações complexas e tarefas de agentes no mundo real, essa lacuna deve ser fechada. Os modelos exigem uma compreensão persistente e robusta do mundo físico que habitam, não apenas uma interpretação superficial de pixels. Até lá, mesmo os destruidores de benchmarks continuarão a colapsar quando confrontados com as verdades mais simples do nosso universo.

Perguntas Frequentes

Qual modelo foi testado no vídeo?

O vídeo testa o modelo DeepSeek V4.1 Flash, um poderoso modelo multimodal Mixture-of-Experts (MoE) lançado em setembro de 2026, usando o harness Codex da OpenAI.

Por que o modelo DeepSeek falhou no teste do Cubo de Rubik?

O modelo falhou porque não conseguiu manter um modelo 3D coerente do Cubo de Rubik. Os quadrados pareciam flutuar independentemente e mudar de cor sem movimento, indicando uma falta fundamental de compreensão espacial e física.

Alguma IA já resolveu um Cubo de Rubik antes?

Sim. Em 2019, o DeepCubeA da UC Irvine, uma IA de aprendizado por reforço profundo, conseguia resolvê-lo em uma fração de segundo. Isso destaca uma lacuna entre a IA especializada e o raciocínio de propósito geral de grandes modelos multimodais.

O que essa falha revela sobre os benchmarks atuais de IA?

Sugere que os benchmarks padrão de agentes e raciocínio podem não testar adequadamente o fundamento físico e a compreensão espacial dinâmica, permitindo que modelos com pontuações altas ainda possuam pontos cegos críticos.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.