Um retrato se torna um teste de uso de computador
Matthew Berman deu ao DeepSeek V4.1 Flash um teste incomum: recriar uma foto de rosto não gerando pixels, mas operando uma réplica baseada na web do Microsoft Paint. Esta não foi uma tarefa padrão de difusão de prompt para imagem; o modelo multimodal teve que traduzir a entrada visual em uma sequência de ações na tela.
O desafio exigiu mais do que apenas reconhecimento de imagem. O DeepSeek V4.1 Flash precisou selecionar cores, escolher tamanhos de pincel e colocar traços em uma tela digital. Este experimento sondou a capacidade do modelo de interpretar uma referência visual e, em seguida, executar ações precisas mediadas por ferramentas.
Um modelo multimodal rápido como o DeepSeek V4.1 Flash conseguiria criar uma imagem coerente operando uma ferramenta, em vez de sintetizar uma diretamente? A configuração de Berman visava determinar se modelos agenticos poderiam ir além da geração de imagem em espaço latente para o reino da GUI interaction, usando um editor de gráficos raster para "pintar" um retrato.
Este teste expandiu os limites do computer use para IA, avaliando se um modelo poderia transformar a compreensão visual em uma série orquestrada de cliques de mouse e movimentos de pincel dentro de um ambiente virtual. Ele questionou se um agente poderia realmente "ver" e depois "agir" para produzir um resultado visual desejado.
O resultado: reconhecível, mas surpreendentemente abstrato
O veredito de Berman sobre o esforço do DeepSeek V4.1 Flash foi "na verdade, não é ruim", uma avaliação surpreendentemente positiva dado o desafio. O retrato resultante, no entanto, foi altamente estilizado e abstrato, capturando uma impressão mais do que uma semelhança. Ele transmitiu formas amplas e uma paleta de cores geral, mas carecia dos detalhes finos e da nuance textural da imagem de referência.
O DeepSeek V4.1 Flash produziu um formato de cabeça reconhecível e uma impressão geral de cores, mas falhou em reproduzir características mais finas como olhos, nariz ou boca com qualquer especificidade. A ausência de textura convincente fez a imagem parecer plana, uma interpretação abstrata em vez de uma recriação detalhada. Este resultado destacou uma limitação crítica em sua abordagem para tarefas visuais orientadas por GUI.
Observando o vídeo, o modelo claramente lutou com a técnica de camadas iterativas comum na pintura digital feita por humanos. Ao contrário de sistemas como o Astra, que emprega pinceladas sequenciais e sobrepostas para construir sombreamento e textura, o DeepSeek V4.1 Flash gerou formas amplas e simplistas. Essa execução mecânica resultou em um retrato que, embora identificável, carecia de detalhes intrincados.
O experimento não foi um teste das capacidades gerais de criação de imagem do DeepSeek, mas sim de sua capacidade de traduzir a observação visual em ações precisas e sequenciais dentro de um ambiente de gráficos raster. O resultado sublinhou uma lacuna no controle motor agentico e no raciocínio espaço-temporal, revelando o teto atual para modelos de nível "Flash" menores e mais rápidos em interações complexas e detalhadas.
Por que as camadas foram a parte difícil
Colocar um único traço em uma tela digital apresenta um desafio; compor centenas de traços, cada um construído sobre o anterior, apresenta outro completamente diferente. O DeepSeek V4.1 Flash conseguiu identificar as formas gerais do rosto de Berman e estabelecer campos de cores amplos. O que ele teve dificuldade foi com a aplicação iterativa e em camadas de detalhes.
Berman destacou essa limitação ao contrastá-la com o Astra, o sistema multimodal do Google. O Astra demonstrou uma compreensão sofisticada de como pinceladas sobrepostas poderiam criar sombreamentos sutis e texturas complexas. O DeepSeek V4.1 Flash, em contrapartida, produziu uma representação “muito abstrata”, carecendo da sobreposição detalhada essencial para os detalhes.
Não se trata apenas de reconhecer um rosto; trata-se de spatial planning (planejamento espacial) e recursive visual feedback (feedback visual recursivo). Pintar um retrato com sucesso usando uma GUI exige que um agente:
- Controle ferramentas com precisão
- Rastreie coordenadas da tela
- Avalie o impacto de cada pincelada
- Planeje ações subsequentes com base nesse feedback
Sem esse loop complexo, o agente recorre a gestos mais simples e amplos. Para mais informações sobre as capacidades e a arquitetura dos modelos, você pode visitar o DeepSeek Official Website. O DeepSeek V4.1 Flash, embora impressionante em sua velocidade e uso básico de ferramentas, encontrou um obstáculo onde era necessária uma composição complexa e iterativa, revelando uma fronteira atual nas habilidades motoras de agentes.
Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.
um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros
A lição mais importante para agentes de IA
O experimento do DeepSeek V4.1 Flash destaca uma distinção crucial nas capacidades de IA. A síntese direta de imagens, como a do Midjourney ou Recraft, gera pixels a partir de um prompt. A ação de um agente, no entanto, exige que uma IA navegue em uma interface real, tomando decisões sequenciais para atingir um objetivo. O DeepSeek teve que observar uma imagem de referência e, em seguida, traduzi-la em comandos baseados em navegador para um programa como o JS Paint.
Isso torna a tarefa de pintura um potente teste de estresse para sistemas de uso de computador. Ao contrário de uma resposta em texto, o resultado visual de um agente manipulando uma GUI expõe imediatamente lacunas no planejamento e na execução. Podemos ver precisamente onde o modelo teve dificuldade em traduzir sua compreensão em pinceladas precisas e iterativas, oferecendo um feedback de diagnóstico mais claro do que uma resposta de texto que parece perfeita, mas é internamente falha.
A tentativa do DeepSeek mostra uma interação básica impressionante com ferramentas. Ele compreendeu a tarefa fundamental, produzindo um retrato reconhecível, embora abstrato. No entanto, o desafio do trabalho detalhado e iterativo — como sobrepor pinceladas para criar sombreamento e textura — continua sendo uma barreira difícil para os modelos atuais de agentic AI (IA agentica). O experimento ressalta a complexidade de transformar a intenção de alto nível em ações granulares de interface no mundo real.
Perguntas Frequentes
O que o DeepSeek V4.1 Flash fez no teste de retrato?
Ele usou uma réplica do Microsoft Paint baseada em navegador para criar um retrato a partir de uma imagem de referência.
Como ficou o retrato do DeepSeek?
O resultado foi estilizado e abstrato, capturando formas e cores amplas, mas sem detalhes finos.
Por que o retrato foi menos detalhado que o do Astra?
O teste destacou a dificuldade do DeepSeek em planejar e sobrepor muitas pinceladas precisas para criar sombreamento e textura.
Pintar com um agente de IA é o mesmo que a geração de texto para imagem?
Não. Um agente deve operar uma interface de desenho por meio de ações sequenciais, enquanto um modelo de texto para imagem gera uma imagem diretamente.

