Skip to content
research

Mistral Large 4 resolveu o cubo — e depois o perdeu

Uma demonstração 3D polida pode esconder uma máquina de estados frágil. Este teste também levanta uma questão mais difícil: quando o código quebra, o modelo falhou — ou foram as ferramentas que o controlavam?

Aki Tanaka
Mistral Large 4 resolveu o cubo — e depois o perdeu

Um cubo que parecia pronto para jogar

Matthew Berman, um proeminente testador de desempenho de IA, desafiou recentemente o Mistral Mistral Large 4 a construir uma simulação de Cubo Mágico interativa baseada em navegador. Esta tarefa vai além da geração de imagens estáticas, exigindo que o modelo produza código funcional capaz de renderizar um objeto 3D e responder à entrada do usuário.

Uma simulação bem-sucedida requer mais do que fidelidade visual. Ela deve:

  • Renderizar os 27 cubinhos individuais que compõem o cubo
  • Aceitar a entrada do usuário para selecionar e girar faces específicas
  • Reter com precisão a cor e a posição de cada face através de transformações complexas

Inicialmente, o Mistral Large 4 entregou um cubo visualmente convincente que permitia a rotação total da câmera. Esta primeira iteração parecia promissora, mas uma falha crítica surgiu: o botão "embaralhar", destinado a randomizar o estado do cubo, permaneceu sem resposta, deixando o cubo perpetuamente resolvido. Berman descreveu isso como uma "falha" em seu teste de cubo, destacando a lacuna entre a saída visual e a interatividade funcional.

A correção quebrou o que funcionava

A segunda tentativa de Berman de obter um Cubo Mágico funcional do Mistral Large 4 gerou um paradoxo frustrante. Após outra iteração, o código gerado implementou com sucesso as rotações laterais, permitindo que os usuários girassem as faces conforme pretendido. No entanto, essa correção introduziu um novo bug: todas as cores desapareceram das superfícies do cubo a cada rotação.

Este resultado destaca uma distinção crucial em simulações 3D. Embora a câmera ainda pudesse orbitar o cubo, oferecendo uma perspectiva dinâmica, esse movimento visual é totalmente separado da mecânica interna do quebra-cabeça. Atualizar corretamente a posição e o estado de cor de uma face requer uma sincronização meticulosa entre a geometria renderizada e o modelo de dados subjacente.

O desafio reside no gerenciamento de transformações 3D, identidades dos cubinhos e materiais renderizados. Cada um dos 26 "cubinhos" visíveis deve manter sua identidade única e informações de cor, mesmo enquanto se move através de diferentes faces e orientações. Quando o código do Mistral Large 4 fez com que as cores desaparecessem, isso sugeriu uma dessincronização: os cubinhos estavam girando fisicamente, mas suas propriedades de material associadas ou mapeamentos de textura UV — como as cores são aplicadas às superfícies — não estavam sendo atualizados corretamente ou estavam sendo sobrescritos.

Isso não é apenas sobre renderização; é sobre gerenciamento de estado persistente. A simulação deve rastrear a posição e a orientação de cada cubinho em relação ao centro do cubo, garantindo que as informações de cor permaneçam consistentemente vinculadas às faces corretas durante cada embaralhamento e giro. O modelo teve dificuldade em manter esse estado complexo e interligado durante as mudanças de código iterativas.

Foi o modelo — ou o ambiente de teste?

O vídeo de Berman, "Mistral Large 4 falhou no meu teste de Cubo Mágico", revela uma nuance crítica frequentemente negligenciada nas avaliações de LLM: ele atribui a falha final não ao Mistral Large 4 em si, mas à interação entre o modelo e seu "harness" (ambiente de teste). Essa distinção é vital para entender o desenvolvimento complexo impulsionado por IA.

O harness refere-se ao fluxo de trabalho do agente ao redor — o sistema automatizado que fornece contexto ao modelo, aplica suas edições e executa ou verifica o código gerado. Seu comportamento pode afetar profundamente o que o modelo consegue corrigir, especialmente em depuração iterativa. Por exemplo, um harness pode aplicar diffs incorretamente, interpretar mal as instruções do modelo ou falhar ao fornecer feedback de teste abrangente.

Neste cenário, embora o Mistral Mistral Large 4 tenha produzido código que tornou as rotações laterais funcionais, o manuseio subsequente do harness pode ter corrompido o estado visual do cubo, fazendo com que as cores desaparecessem. O vídeo demonstra o resultado, mas não isola a causa raiz, tornando difícil atribuir a culpa definitivamente ao raciocínio do modelo, ao código gerado, à aplicação de edição ou ao framework de teste.

Isso destaca um desafio crescente no desenvolvimento assistido por IA: separar as capacidades do modelo do desempenho das ferramentas que os orquestram. À medida que os modelos se tornam mais sofisticados, a qualidade do harness — sua capacidade de manter o estado, gerenciar edições de vários arquivos e fornecer feedback preciso — torna-se um gargalo. Desenvolvedores que buscam mais detalhes sobre os avanços contínuos da Mistral podem consultar Mistral AI - Latest News and Model Announcements. Essa distinção é crucial para entender por que tarefas complexas como um teste de Rubik's cube podem falhar mesmo com modelos poderosos.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

Por que este pequeno teste tem apostas maiores

O teste de cubo de Berman destaca uma distinção crítica: benchmarks de codificação estáticos ou renderizações iniciais atraentes muitas vezes ignoram fraquezas centrais. Tarefas interativas e com estado expõem como uma IA lida com dados persistentes, ouvintes de eventos e atualizações de interface em tempo real ao longo de várias rodadas. Um modelo pode gerar um código inicial bonito, mas falhar em manter a consistência quando o usuário interage com ele, ou quando o próprio sistema itera sobre o código.

Para desenvolvedores, isso oferece uma lição prática. Julgue as ferramentas de codificação de IA pelo seu comportamento de ponta a ponta, não apenas por uma captura de tela da saída inicial. Avalie o desempenho em interações repetidas e integre verificações de regressão ao seu fluxo de trabalho. Essas etapas revelam se uma IA pode construir sistemas robustos e sustentáveis ou apenas gerar pontos de partida impressionantes, porém frágeis.

O desempenho do Mistral Mistral Large 4 no Rubik's cube test serve como uma falha reveladora do fluxo de trabalho tentado. O modelo conseguiu gerar um objeto 3D interativo visualmente atraente e, posteriormente, rotações funcionais. Mas a interação complexa de coordenadas espaciais, sincronização de estado e renderização de interface provou ser demais para o processo iterativo que Berman empregou.

Embora esta demonstração única não possa provar amplamente que o Mistral Mistral Large 4 é incapaz de codificar, ela ressalta os desafios na geração de código com estado e em várias rodadas. O problema, como sugere Berman, provavelmente reside na interação entre o modelo e seu harness, não apenas nas capacidades intrínsecas do modelo. Essa dança complexa entre a IA e seu ambiente operacional permanece um obstáculo significativo para agentes de codificação de IA avançados.

Perguntas Frequentes

O que o Mistral Large 4 errou no teste do Rubik’s Cube?

Sua primeira versão renderizou um cubo, mas não respondeu ao botão de embaralhar. Uma iteração posterior permitiu a rotação das faces, mas as cores do cubo desapareceram.

O Mistral Large 4 falhou em entender como um Rubik’s Cube funciona?

O teste não estabelece isso. Ele mostra que a implementação gerada teve dificuldade em manter as interações e o estado visual funcionando juntos.

O que significa “harness” neste teste?

O harness é o conjunto de ferramentas e fluxo de trabalho em torno do modelo que gerencia edições, contexto, execução de código e iteração.

Por que um Rubik’s Cube é um teste de codificação de IA difícil?

Uma simulação funcional deve coordenar renderização 3D, rotações de faces, controles e estado de cor persistente — não apenas desenhar um cubo.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.