Un retrato se convierte en una prueba de uso de computadora
Matthew Berman sometió a DeepSeek V4.1 Flash a una prueba inusual: recrear una foto de perfil no generando píxeles, sino operando una réplica basada en web de Microsoft Paint. No fue una tarea estándar de difusión de texto a imagen; el modelo multimodal tuvo que traducir la entrada visual en una secuencia de acciones sobre el lienzo.
El desafío exigía más que solo reconocimiento de imágenes. DeepSeek V4.1 Flash necesitaba seleccionar colores, elegir tamaños de pincel y colocar trazos en un lienzo digital. Este experimento sondeó la capacidad del modelo para interpretar una referencia visual y luego ejecutar acciones precisas mediadas por herramientas.
¿Podría un modelo multimodal rápido como DeepSeek V4.1 Flash crear una imagen coherente operando una herramienta, en lugar de sintetizarla directamente? La configuración de Berman tenía como objetivo determinar si los modelos agentes podían ir más allá de la generación de imágenes en el espacio latente hacia el ámbito de la GUI interaction, utilizando un editor de gráficos rasterizados para "pintar" un retrato.
Esta prueba superó los límites del computer use para la IA, evaluando si un modelo podía transformar la comprensión visual en una serie orquestada de clics de ratón y movimientos de pincel dentro de un entorno virtual. Se preguntó si un agente podía realmente "ver" y luego "actuar" para producir un resultado visual deseado.
El resultado: reconocible, pero sorprendentemente abstracto
El veredicto de Berman sobre el esfuerzo de DeepSeek V4.1 Flash fue "en realidad no está mal", una evaluación sorprendentemente positiva dado el desafío. El retrato resultante, sin embargo, fue altamente estilizado y abstracto, capturando una impresión más que una semejanza. Transmitió formas amplias y una paleta de colores general, pero careció de los detalles finos y el matiz textural de la imagen de referencia.
DeepSeek V4.1 Flash produjo una forma de cabeza reconocible y una impresión general de color, pero no logró reproducir rasgos más finos como los ojos, la nariz o la boca con ninguna especificidad. La ausencia de una textura convincente hizo que la imagen se sintiera plana, una interpretación abstracta en lugar de una recreación detallada. Este resultado destacó una limitación crítica en su enfoque de las tareas visuales impulsadas por GUI.
Al observar el video, el modelo claramente luchó con la técnica de capas iterativas común en la pintura digital humana. A diferencia de sistemas como Astra, que emplea trazos de pincel secuenciales y superpuestos para construir sombreado y textura, DeepSeek V4.1 Flash generó formas amplias y simplistas. Esta ejecución mecánica resultó en un retrato que, aunque identificable, carecía de detalles intrincados.
El experimento no fue una prueba de las capacidades generales de creación de imágenes de DeepSeek, sino más bien de su capacidad para traducir la observación visual en acciones precisas y secuenciales dentro de un entorno de gráficos rasterizados. El resultado subrayó una brecha en el control motor agente y el razonamiento espacio-temporal, revelando el techo actual para los modelos de nivel "Flash" más pequeños y rápidos en interacciones complejas y detalladas.
Por qué las capas fueron la parte difícil
Colocar un solo trazo en un lienzo digital presenta un desafío; componer cientos de trazos, cada uno construyendo sobre el anterior, presenta otro completamente distinto. DeepSeek V4.1 Flash pudo identificar las formas generales del rostro de Berman y establecer campos de color amplios. Con lo que luchó fue con la aplicación iterativa y en capas de los detalles.
Berman destacó esta limitación contrastándola con Astra, el sistema multimodal de Google. Astra demostró una comprensión sofisticada de cómo la superposición de pinceladas podía crear sombreados sutiles y texturas complejas. DeepSeek V4.1 Flash, por el contrario, produjo una representación "muy abstracta", carente de las capas matizadas esenciales para el detalle.
No se trata solo de reconocer un rostro; se trata de planificación espacial y retroalimentación visual recursiva. Pintar un retrato con éxito mediante una GUI requiere que un agente:
- Controle las herramientas con precisión
- Rastree las coordenadas del lienzo
- Evalúe el impacto de cada trazo
- Planifique las acciones posteriores basándose en esa retroalimentación
Sin este bucle intrincado, el agente recurre a gestos más simples y amplios. Para obtener más información sobre las capacidades y la arquitectura de los modelos, puede visitar el DeepSeek Official Website. DeepSeek V4.1 Flash, aunque impresionante en su velocidad y uso básico de herramientas, se topó con un muro cuando se requería una composición compleja e iterativa, lo que revela una frontera actual en las habilidades motoras de los agentes.
¿Te está gustando? Recibe uno así en tu bandeja cada mañana.
un correo al día · date de baja en dos clics · sin rastreadores de terceros
La lección más importante para los agentes de IA
El experimento de DeepSeek V4.1 Flash destaca una distinción crucial en las capacidades de la IA. La síntesis directa de imágenes, como la de Midjourney o Recraft, genera píxeles a partir de un prompt. La acción de los agentes, sin embargo, requiere que una IA navegue por una interfaz real, tomando decisiones secuenciales para lograr un objetivo. DeepSeek tuvo que observar una imagen de referencia y luego traducirla a comandos basados en el navegador para un programa como JS Paint.
Esto convierte la tarea de pintar en una potente prueba de estrés para los sistemas de uso informático. A diferencia de una respuesta de texto, el resultado visual de un agente que manipula una GUI expone inmediatamente las brechas en la planificación y la ejecución. Podemos ver con precisión dónde tuvo dificultades el modelo para traducir su comprensión en trazos precisos e iterativos, ofreciendo una retroalimentación de diagnóstico más clara que una respuesta de texto que parece perfecta pero que es internamente defectuosa.
El intento de DeepSeek muestra una interacción básica impresionante con las herramientas. Comprendió la tarea fundamental, produciendo un retrato reconocible aunque abstracto. Sin embargo, el desafío del trabajo detallado e iterativo, como la superposición de trazos para crear sombreado y textura, sigue siendo un listón difícil para los modelos actuales de agentic AI. El experimento subraya la complejidad de transformar la intención de alto nivel en acciones granulares en interfaces del mundo real.
Preguntas frecuentes
¿Qué hizo DeepSeek V4.1 Flash en la prueba de retrato?
Utilizó una réplica de Microsoft Paint basada en navegador para crear un retrato a partir de una imagen de referencia.
¿Cómo fue el retrato de DeepSeek?
El resultado fue estilizado y abstracto, capturando formas y colores generales pero careciendo de detalles finos.
¿Por qué el retrato fue menos detallado que el de Astra?
La prueba destacó la dificultad de DeepSeek para planificar y superponer muchos trazos de pincel precisos para crear sombreado y textura.
¿Es pintar con un agente de IA lo mismo que la generación de texto a imagen?
No. Un agente debe operar una interfaz de dibujo a través de acciones secuenciales, mientras que un modelo de texto a imagen genera una imagen directamente.

