Skip to content
ai agents

O DeepSeek tentou pintar — e deu com a cara na parede

Um experimento de retrato transforma uma tarefa simples de navegador em um teste revelador da capacidade da IA de ver, planejar e agir. A lacuna surpreendente não é apenas sobre gosto artístico — é sobre o que acontece quando um modelo precisa construir uma imagem um movimento de cada vez.

Sol Aguirre
O DeepSeek tentou pintar — e deu com a cara na parede

Um retrato se torna um teste de uso de computador

Matthew Berman deu ao DeepSeek V4.1 Flash um teste incomum: recriar uma foto de rosto não gerando pixels, mas operando uma réplica baseada na web do Microsoft Paint. Esta não foi uma tarefa padrão de difusão de prompt para imagem; o modelo multimodal teve que traduzir a entrada visual em uma sequência de ações na tela.

O desafio exigiu mais do que apenas reconhecimento de imagem. O DeepSeek V4.1 Flash precisou selecionar cores, escolher tamanhos de pincel e colocar traços em uma tela digital. Este experimento sondou a capacidade do modelo de interpretar uma referência visual e, em seguida, executar ações precisas mediadas por ferramentas.

Um modelo multimodal rápido como o DeepSeek V4.1 Flash conseguiria criar uma imagem coerente operando uma ferramenta, em vez de sintetizar uma diretamente? A configuração de Berman visava determinar se modelos agenticos poderiam ir além da geração de imagem em espaço latente para o reino da GUI interaction, usando um editor de gráficos raster para "pintar" um retrato.

Este teste expandiu os limites do computer use para IA, avaliando se um modelo poderia transformar a compreensão visual em uma série orquestrada de cliques de mouse e movimentos de pincel dentro de um ambiente virtual. Ele questionou se um agente poderia realmente "ver" e depois "agir" para produzir um resultado visual desejado.

O resultado: reconhecível, mas surpreendentemente abstrato

O veredito de Berman sobre o esforço do DeepSeek V4.1 Flash foi "na verdade, não é ruim", uma avaliação surpreendentemente positiva dado o desafio. O retrato resultante, no entanto, foi altamente estilizado e abstrato, capturando uma impressão mais do que uma semelhança. Ele transmitiu formas amplas e uma paleta de cores geral, mas carecia dos detalhes finos e da nuance textural da imagem de referência.

O DeepSeek V4.1 Flash produziu um formato de cabeça reconhecível e uma impressão geral de cores, mas falhou em reproduzir características mais finas como olhos, nariz ou boca com qualquer especificidade. A ausência de textura convincente fez a imagem parecer plana, uma interpretação abstrata em vez de uma recriação detalhada. Este resultado destacou uma limitação crítica em sua abordagem para tarefas visuais orientadas por GUI.

Observando o vídeo, o modelo claramente lutou com a técnica de camadas iterativas comum na pintura digital feita por humanos. Ao contrário de sistemas como o Astra, que emprega pinceladas sequenciais e sobrepostas para construir sombreamento e textura, o DeepSeek V4.1 Flash gerou formas amplas e simplistas. Essa execução mecânica resultou em um retrato que, embora identificável, carecia de detalhes intrincados.

O experimento não foi um teste das capacidades gerais de criação de imagem do DeepSeek, mas sim de sua capacidade de traduzir a observação visual em ações precisas e sequenciais dentro de um ambiente de gráficos raster. O resultado sublinhou uma lacuna no controle motor agentico e no raciocínio espaço-temporal, revelando o teto atual para modelos de nível "Flash" menores e mais rápidos em interações complexas e detalhadas.

Por que as camadas foram a parte difícil

Colocar um único traço em uma tela digital apresenta um desafio; compor centenas de traços, cada um construído sobre o anterior, apresenta outro completamente diferente. O DeepSeek V4.1 Flash conseguiu identificar as formas gerais do rosto de Berman e estabelecer campos de cores amplos. O que ele teve dificuldade foi com a aplicação iterativa e em camadas de detalhes.

Berman destacou essa limitação ao contrastá-la com o Astra, o sistema multimodal do Google. O Astra demonstrou uma compreensão sofisticada de como pinceladas sobrepostas poderiam criar sombreamentos sutis e texturas complexas. O DeepSeek V4.1 Flash, em contrapartida, produziu uma representação “muito abstrata”, carecendo da sobreposição detalhada essencial para os detalhes.

Não se trata apenas de reconhecer um rosto; trata-se de spatial planning (planejamento espacial) e recursive visual feedback (feedback visual recursivo). Pintar um retrato com sucesso usando uma GUI exige que um agente:

  • Controle ferramentas com precisão
  • Rastreie coordenadas da tela
  • Avalie o impacto de cada pincelada
  • Planeje ações subsequentes com base nesse feedback

Sem esse loop complexo, o agente recorre a gestos mais simples e amplos. Para mais informações sobre as capacidades e a arquitetura dos modelos, você pode visitar o DeepSeek Official Website. O DeepSeek V4.1 Flash, embora impressionante em sua velocidade e uso básico de ferramentas, encontrou um obstáculo onde era necessária uma composição complexa e iterativa, revelando uma fronteira atual nas habilidades motoras de agentes.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

A lição mais importante para agentes de IA

O experimento do DeepSeek V4.1 Flash destaca uma distinção crucial nas capacidades de IA. A síntese direta de imagens, como a do Midjourney ou Recraft, gera pixels a partir de um prompt. A ação de um agente, no entanto, exige que uma IA navegue em uma interface real, tomando decisões sequenciais para atingir um objetivo. O DeepSeek teve que observar uma imagem de referência e, em seguida, traduzi-la em comandos baseados em navegador para um programa como o JS Paint.

Isso torna a tarefa de pintura um potente teste de estresse para sistemas de uso de computador. Ao contrário de uma resposta em texto, o resultado visual de um agente manipulando uma GUI expõe imediatamente lacunas no planejamento e na execução. Podemos ver precisamente onde o modelo teve dificuldade em traduzir sua compreensão em pinceladas precisas e iterativas, oferecendo um feedback de diagnóstico mais claro do que uma resposta de texto que parece perfeita, mas é internamente falha.

A tentativa do DeepSeek mostra uma interação básica impressionante com ferramentas. Ele compreendeu a tarefa fundamental, produzindo um retrato reconhecível, embora abstrato. No entanto, o desafio do trabalho detalhado e iterativo — como sobrepor pinceladas para criar sombreamento e textura — continua sendo uma barreira difícil para os modelos atuais de agentic AI (IA agentica). O experimento ressalta a complexidade de transformar a intenção de alto nível em ações granulares de interface no mundo real.

Perguntas Frequentes

O que o DeepSeek V4.1 Flash fez no teste de retrato?

Ele usou uma réplica do Microsoft Paint baseada em navegador para criar um retrato a partir de uma imagem de referência.

Como ficou o retrato do DeepSeek?

O resultado foi estilizado e abstrato, capturando formas e cores amplas, mas sem detalhes finos.

Por que o retrato foi menos detalhado que o do Astra?

O teste destacou a dificuldade do DeepSeek em planejar e sobrepor muitas pinceladas precisas para criar sombreamento e textura.

Pintar com um agente de IA é o mesmo que a geração de texto para imagem?

Não. Um agente deve operar uma interface de desenho por meio de ações sequenciais, enquanto um modelo de texto para imagem gera uma imagem diretamente.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabalhando para a ferramenta de outra pessoa.

Agentes de IA leem. Compradores chegam nela. Ela responde em oito idiomas e via MCP. Sua ferramenta pode ter uma assim — no ar em 24 horas.