Un portrait devient un test d'utilisation de l'ordinateur
Matthew Berman a soumis DeepSeek V4.1 Flash à un test inhabituel : recréer une photo d'identité non pas en générant des pixels, mais en utilisant une réplique de Microsoft Paint basée sur le web. Il ne s'agissait pas d'une tâche standard de diffusion de texte à image ; le modèle multimodal devait traduire une entrée visuelle en une séquence d'actions sur la toile.
Le défi exigeait bien plus qu'une simple reconnaissance d'image. DeepSeek V4.1 Flash devait sélectionner des couleurs, choisir la taille des pinceaux et placer des traits sur une toile numérique. Cette expérience a sondé la capacité du modèle à interpréter une référence visuelle, puis à exécuter des actions précises médiatisées par des outils.
Un modèle multimodal rapide comme DeepSeek V4.1 Flash pourrait-il créer une image cohérente en utilisant un outil, plutôt qu'en en synthétisant une directement ? La configuration de Berman visait à déterminer si les modèles agentiques pouvaient aller au-delà de la génération d'images dans l'espace latent pour entrer dans le domaine de l'interaction GUI, en utilisant un éditeur graphique matriciel pour « peindre » un portrait.
Ce test a repoussé les limites de l'utilisation de l'ordinateur pour l'IA, en évaluant si un modèle pouvait transformer une compréhension visuelle en une série orchestrée de clics de souris et de mouvements de pinceau dans un environnement virtuel. Il posait la question de savoir si un agent pouvait réellement « voir » puis « agir » pour produire un résultat visuel souhaité.
Le résultat : reconnaissable, mais étonnamment abstrait
Le verdict de Berman sur l'effort de DeepSeek V4.1 Flash était « en fait pas mal », une évaluation étonnamment positive compte tenu du défi. Le portrait résultant était cependant très stylisé et abstrait, capturant une impression plus qu'une ressemblance. Il transmettait des formes larges et une palette de couleurs générale, mais manquait des détails fins et de la nuance texturale de l'image de référence.
DeepSeek V4.1 Flash a produit une forme de tête reconnaissable et une impression de couleur globale, mais a échoué à reproduire des traits plus fins comme les yeux, le nez ou la bouche avec une quelconque précision. L'absence de texture convaincante a rendu l'image plate, une interprétation abstraite plutôt qu'une recréation détaillée. Ce résultat a mis en évidence une limitation critique dans son approche des tâches visuelles pilotées par GUI.
En observant la vidéo, le modèle a clairement eu du mal avec la technique de superposition itérative courante dans la peinture numérique humaine. Contrairement à des systèmes comme Astra, qui emploie des coups de pinceau séquentiels et superposés pour construire les ombres et la texture, DeepSeek V4.1 Flash a généré des formes larges et simplistes. Cette exécution mécanique a abouti à un portrait qui, bien qu'identifiable, manquait de détails complexes.
L'expérience n'était pas un test des capacités générales de création d'images de DeepSeek, mais plutôt de sa capacité à traduire une observation visuelle en actions précises et séquentielles dans un environnement graphique matriciel. Le résultat a souligné un écart dans le contrôle moteur agentique et le raisonnement spatio-temporel, révélant le plafond actuel des modèles de niveau « Flash » plus petits et plus rapides dans les interactions complexes et fines.
Pourquoi la superposition était la partie difficile
Placer un seul trait sur une toile numérique présente un défi ; en composer des centaines, chacun s'appuyant sur le précédent, en présente un autre entièrement. DeepSeek V4.1 Flash pouvait identifier les formes générales du visage de Berman et poser de larges champs de couleur. Ce avec quoi il a eu du mal, c'est l'application itérative et superposée des détails.
Berman a souligné cette limite en la comparant à Astra, le système multimodal de Google. Astra a démontré une compréhension sophistiquée de la manière dont le chevauchement des coups de pinceau pouvait créer des ombres subtiles et des textures complexes. DeepSeek V4.1 Flash, en revanche, a produit un rendu « très abstrait », manquant de la superposition nuancée essentielle aux détails.
Il ne s'agit pas seulement de reconnaître un visage ; il est question de planification spatiale et de rétroaction visuelle récursive. Pour peindre un portrait avec succès via une interface graphique (GUI), un agent doit :
- Contrôler précisément les outils
- Suivre les coordonnées du canevas
- Évaluer l'impact de chaque coup de pinceau
- Planifier les actions suivantes en fonction de ce retour
Sans cette boucle complexe, l'agent a recours à des gestes plus simples et plus larges. Pour en savoir plus sur les capacités et l'architecture des modèles, vous pouvez visiter le site officiel de DeepSeek. DeepSeek V4.1 Flash, bien qu'impressionnant par sa vitesse et son utilisation basique des outils, s'est heurté à un obstacle là où une composition complexe et itérative était requise, révélant une frontière actuelle des compétences motrices des agents.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
La leçon majeure pour les agents IA
L'expérience DeepSeek V4.1 Flash met en lumière une distinction cruciale dans les capacités de l'IA. La synthèse d'image directe, comme celle de Midjourney ou Recraft, génère des pixels à partir d'une invite. L'action agentique, cependant, exige qu'une IA navigue dans une interface réelle, en prenant des décisions séquentielles pour atteindre un objectif. DeepSeek a dû observer une image de référence, puis la traduire en commandes basées sur le navigateur pour un programme comme JS Paint.
Cela fait de la tâche de peinture un test de résistance puissant pour les systèmes utilisant l'ordinateur. Contrairement à une réponse textuelle, le résultat visuel d'un agent manipulant une interface graphique expose immédiatement les lacunes dans la planification et l'exécution. Nous pouvons voir précisément où le modèle a eu du mal à traduire sa compréhension en coups de pinceau précis et itératifs, offrant un diagnostic plus clair qu'une réponse textuelle parfaite en apparence mais défaillante en interne.
La tentative de DeepSeek montre une interaction de base impressionnante avec les outils. Il a saisi la tâche fondamentale, produisant un portrait reconnaissable bien qu'abstrait. Pourtant, le défi d'un travail détaillé et itératif—comme la superposition de coups de pinceau pour créer des ombres et de la texture—reste une barre haute pour les modèles d'IA agentique actuels. L'expérience souligne la complexité de transformer une intention de haut niveau en actions granulaires sur une interface réelle.
Foire aux questions
Qu'a fait DeepSeek V4.1 Flash lors du test de portrait ?
Il a utilisé une réplique de Microsoft Paint basée sur un navigateur pour créer un portrait à partir d'une image de référence.
À quoi ressemblait le portrait de DeepSeek ?
Le résultat était stylisé et abstrait, capturant les formes et les couleurs globales mais manquant de détails fins.
Pourquoi le portrait était-il moins détaillé que celui d'Astra ?
Le test a mis en évidence la difficulté de DeepSeek à planifier et à superposer de nombreux coups de pinceau précis pour créer des ombres et de la texture.
Peindre avec un agent IA est-il la même chose que la génération texte-vers-image ?
Non. Un agent doit faire fonctionner une interface de dessin par des actions séquentielles, tandis qu'un modèle texte-vers-image génère une image directement.

