Ein Porträt wird zum Test für die Computernutzung
Matthew Berman unterzog DeepSeek V4.1 Flash einem ungewöhnlichen Test: Er sollte ein Porträtfoto nachbilden, nicht durch das Generieren von Pixeln, sondern durch die Bedienung einer webbasierten Kopie von Microsoft Paint. Dies war keine standardmäßige Prompt-zu-Bild-Diffusionsaufgabe; das multimodale Modell musste visuelle Eingaben in eine Abfolge von Leinwand-Aktionen übersetzen.
Die Herausforderung erforderte mehr als nur Bilderkennung. DeepSeek V4.1 Flash musste Farben auswählen, Pinselgrößen bestimmen und Striche auf einer digitalen Leinwand platzieren. Dieses Experiment untersuchte die Fähigkeit des Modells, eine visuelle Referenz zu interpretieren und dann präzise, werkzeuggestützte Aktionen auszuführen.
Könnte ein schnelles multimodales Modell wie DeepSeek V4.1 Flash ein stimmiges Bild erzeugen, indem es ein Werkzeug bedient, anstatt eines direkt zu synthetisieren? Bermans Versuchsaufbau zielte darauf ab festzustellen, ob agentische Modelle über die Bildgenerierung im latenten Raum hinaus in den Bereich der GUI interaction vordringen können, indem sie einen Rastergrafik-Editor nutzen, um ein Porträt zu „malen“.
Dieser Test verschob die Grenzen der computer use für KI und bewertete, ob ein Modell visuelles Verständnis in eine orchestrierte Serie von Mausklicks und Pinselbewegungen innerhalb einer virtuellen Umgebung umwandeln kann. Er stellte die Frage, ob ein Agent wirklich „sehen“ und dann „handeln“ kann, um ein gewünschtes visuelles Ergebnis zu erzielen.
Das Ergebnis: erkennbar, aber auffallend abstrakt
Bermans Urteil über den Versuch von DeepSeek V4.1 Flash war „eigentlich nicht schlecht“, eine überraschend positive Einschätzung angesichts der Herausforderung. Das resultierende Porträt war jedoch stark stilisiert und abstrakt und fing eher einen Eindruck als eine Ähnlichkeit ein. Es vermittelte grobe Formen und eine allgemeine Farbpalette, ließ jedoch die feinen Details und die texturale Nuancierung des Referenzbildes vermissen.
DeepSeek V4.1 Flash erzeugte eine erkennbare Kopfform und einen allgemeinen Farbeindruck, scheiterte jedoch daran, feinere Merkmale wie Augen, Nase oder Mund spezifisch wiederzugeben. Das Fehlen überzeugender Texturen ließ das Bild flach wirken – eine abstrakte Interpretation statt einer detaillierten Nachbildung. Dieses Ergebnis verdeutlichte eine kritische Einschränkung bei seinem Ansatz für GUI-gesteuerte visuelle Aufgaben.
Bei der Beobachtung des Videos wurde deutlich, dass das Modell mit der iterativen Schichttechnik, die bei menschlicher digitaler Malerei üblich ist, zu kämpfen hatte. Im Gegensatz zu Systemen wie Astra, das sequentielle, überlappende Pinselstriche verwendet, um Schattierungen und Texturen aufzubauen, generierte DeepSeek V4.1 Flash breite, simplistische Formen. Diese mechanische Ausführung führte zu einem Porträt, das zwar identifizierbar war, dem es jedoch an komplexen Details mangelte.
Das Experiment war kein Test der allgemeinen Bildgenerierungsfähigkeiten von DeepSeek, sondern vielmehr seiner Fähigkeit, visuelle Beobachtungen in präzise, sequentielle Aktionen innerhalb einer Rastergrafikumgebung zu übersetzen. Das Ergebnis unterstrich eine Lücke in der agentischen Motorik und dem raum-zeitlichen Denken und enthüllte die aktuelle Obergrenze für kleinere, schnellere „Flash“-Modelle bei komplexen, feingliedrigen Interaktionen.
Warum das Schichten der schwierige Teil war
Einen einzelnen Strich auf einer digitalen Leinwand zu platzieren, stellt eine Herausforderung dar; Hunderte von Strichen zu komponieren, von denen jeder auf dem vorherigen aufbaut, stellt eine ganz andere dar. DeepSeek V4.1 Flash konnte die allgemeinen Formen von Bermans Gesicht identifizieren und breite Farbfelder anlegen. Womit es jedoch zu kämpfen hatte, war die iterative, schichtweise Anwendung von Details.
Berman hob diese Einschränkung hervor, indem er sie Astra, dem multimodalen System von Google, gegenüberstellte. Astra demonstrierte ein ausgefeiltes Verständnis dafür, wie sich überlappende Pinselstriche subtile Schattierungen und komplexe Texturen erzeugen lassen. DeepSeek V4.1 Flash hingegen lieferte eine „sehr abstrakte“ Wiedergabe, der es an der für Details wesentlichen nuancierten Schichtung fehlte.
Hier geht es nicht nur um das Erkennen eines Gesichts, sondern um spatial planning (räumliche Planung) und recursive visual feedback (rekursives visuelles Feedback). Um erfolgreich ein Porträt mit einer GUI zu malen, muss ein Agent:
- Werkzeuge präzise steuern
- Leinwandkoordinaten verfolgen
- Die Wirkung jedes Strichs bewerten
- Nachfolgende Aktionen basierend auf diesem Feedback planen
Ohne diesen komplexen Kreislauf greift der Agent auf einfachere, gröbere Gesten zurück. Weitere Informationen zu den Fähigkeiten und der Architektur der Modelle finden Sie auf der DeepSeek Official Website. DeepSeek V4.1 Flash stieß, trotz beeindruckender Geschwindigkeit und grundlegender Werkzeugnutzung, an seine Grenzen, als komplexe, iterative Kompositionen erforderlich waren – was eine aktuelle Grenze bei agentischen motorischen Fähigkeiten aufzeigt.
Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.
eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte
Die wichtigere Lektion für KI-Agenten
Das Experiment mit DeepSeek V4.1 Flash verdeutlicht einen entscheidenden Unterschied bei KI-Fähigkeiten. Direkte Bildsynthese, wie sie von Midjourney oder Recraft stammt, generiert Pixel aus einem Prompt. Agentisches Handeln erfordert jedoch, dass eine KI eine echte Benutzeroberfläche bedient und sequenzielle Entscheidungen trifft, um ein Ziel zu erreichen. DeepSeek musste ein Referenzbild beobachten und dies dann in browserbasierte Befehle für ein Programm wie JS Paint übersetzen.
Dies macht die Malaufgabe zu einem wirkungsvollen Stresstest für Computer-Use-Systeme. Im Gegensatz zu einer Textantwort offenbart das visuelle Ergebnis eines Agenten, der eine GUI manipuliert, sofort Lücken in der Planung und Ausführung. Wir können genau sehen, wo das Modell Schwierigkeiten hatte, sein Verständnis in präzise, iterative Striche umzusetzen, was ein klareres diagnostisches Feedback bietet als eine perfekt aussehende, aber inhaltlich fehlerhafte Textantwort.
DeepSeeks Versuch zeigt eine beeindruckende grundlegende Interaktion mit Werkzeugen. Es erfasste die grundlegende Aufgabe und erstellte ein erkennbares, wenn auch abstraktes Porträt. Dennoch bleibt die Herausforderung detaillierter, iterativer Arbeit – wie das Schichten von Strichen zum Aufbau von Schattierungen und Texturen – eine hohe Hürde für aktuelle agentic AI-Modelle. Das Experiment unterstreicht die Komplexität, hochgradige Absichten in granulare, reale Schnittstellenaktionen umzusetzen.
Häufig gestellte Fragen
Was hat DeepSeek V4.1 Flash beim Porträttest getan?
Es nutzte eine browserbasierte Microsoft Paint-Nachbildung, um ein Porträt anhand eines Referenzbildes zu erstellen.
Wie sah das DeepSeek-Porträt aus?
Das Ergebnis war stilisiert und abstrakt; es erfasste grobe Formen und Farben, ließ jedoch feine Details vermissen.
Warum war das Porträt weniger detailliert als das von Astra?
Der Test verdeutlichte die Schwierigkeit von DeepSeek, viele präzise Pinselstriche zu planen und zu schichten, um Schattierungen und Texturen aufzubauen.
Ist das Malen mit einem KI-Agenten dasselbe wie Text-to-Image-Generierung?
Nein. Ein Agent muss eine Zeichenoberfläche durch sequenzielle Aktionen bedienen, während ein Text-to-Image-Modell ein Bild direkt generiert.

