Skip to content
ai agents

DeepSeek hat versucht zu malen – und ist an seine Grenzen gestoßen

Ein Porträt-Experiment macht aus einer einfachen Browser-Aufgabe einen aufschlussreichen Test für die Fähigkeit einer KI, zu sehen, zu planen und zu handeln. Die überraschende Lücke liegt nicht nur am künstlerischen Geschmack – es geht darum, was passiert, wenn ein Modell ein Bild Schritt für Schritt aufbauen muss.

Sol Aguirre
DeepSeek hat versucht zu malen – und ist an seine Grenzen gestoßen

Ein Porträt wird zum Test für die Computernutzung

Matthew Berman unterzog DeepSeek V4.1 Flash einem ungewöhnlichen Test: Er sollte ein Porträtfoto nachbilden, nicht durch das Generieren von Pixeln, sondern durch die Bedienung einer webbasierten Kopie von Microsoft Paint. Dies war keine standardmäßige Prompt-zu-Bild-Diffusionsaufgabe; das multimodale Modell musste visuelle Eingaben in eine Abfolge von Leinwand-Aktionen übersetzen.

Die Herausforderung erforderte mehr als nur Bilderkennung. DeepSeek V4.1 Flash musste Farben auswählen, Pinselgrößen bestimmen und Striche auf einer digitalen Leinwand platzieren. Dieses Experiment untersuchte die Fähigkeit des Modells, eine visuelle Referenz zu interpretieren und dann präzise, werkzeuggestützte Aktionen auszuführen.

Könnte ein schnelles multimodales Modell wie DeepSeek V4.1 Flash ein stimmiges Bild erzeugen, indem es ein Werkzeug bedient, anstatt eines direkt zu synthetisieren? Bermans Versuchsaufbau zielte darauf ab festzustellen, ob agentische Modelle über die Bildgenerierung im latenten Raum hinaus in den Bereich der GUI interaction vordringen können, indem sie einen Rastergrafik-Editor nutzen, um ein Porträt zu „malen“.

Dieser Test verschob die Grenzen der computer use für KI und bewertete, ob ein Modell visuelles Verständnis in eine orchestrierte Serie von Mausklicks und Pinselbewegungen innerhalb einer virtuellen Umgebung umwandeln kann. Er stellte die Frage, ob ein Agent wirklich „sehen“ und dann „handeln“ kann, um ein gewünschtes visuelles Ergebnis zu erzielen.

Das Ergebnis: erkennbar, aber auffallend abstrakt

Bermans Urteil über den Versuch von DeepSeek V4.1 Flash war „eigentlich nicht schlecht“, eine überraschend positive Einschätzung angesichts der Herausforderung. Das resultierende Porträt war jedoch stark stilisiert und abstrakt und fing eher einen Eindruck als eine Ähnlichkeit ein. Es vermittelte grobe Formen und eine allgemeine Farbpalette, ließ jedoch die feinen Details und die texturale Nuancierung des Referenzbildes vermissen.

DeepSeek V4.1 Flash erzeugte eine erkennbare Kopfform und einen allgemeinen Farbeindruck, scheiterte jedoch daran, feinere Merkmale wie Augen, Nase oder Mund spezifisch wiederzugeben. Das Fehlen überzeugender Texturen ließ das Bild flach wirken – eine abstrakte Interpretation statt einer detaillierten Nachbildung. Dieses Ergebnis verdeutlichte eine kritische Einschränkung bei seinem Ansatz für GUI-gesteuerte visuelle Aufgaben.

Bei der Beobachtung des Videos wurde deutlich, dass das Modell mit der iterativen Schichttechnik, die bei menschlicher digitaler Malerei üblich ist, zu kämpfen hatte. Im Gegensatz zu Systemen wie Astra, das sequentielle, überlappende Pinselstriche verwendet, um Schattierungen und Texturen aufzubauen, generierte DeepSeek V4.1 Flash breite, simplistische Formen. Diese mechanische Ausführung führte zu einem Porträt, das zwar identifizierbar war, dem es jedoch an komplexen Details mangelte.

Das Experiment war kein Test der allgemeinen Bildgenerierungsfähigkeiten von DeepSeek, sondern vielmehr seiner Fähigkeit, visuelle Beobachtungen in präzise, sequentielle Aktionen innerhalb einer Rastergrafikumgebung zu übersetzen. Das Ergebnis unterstrich eine Lücke in der agentischen Motorik und dem raum-zeitlichen Denken und enthüllte die aktuelle Obergrenze für kleinere, schnellere „Flash“-Modelle bei komplexen, feingliedrigen Interaktionen.

Warum das Schichten der schwierige Teil war

Einen einzelnen Strich auf einer digitalen Leinwand zu platzieren, stellt eine Herausforderung dar; Hunderte von Strichen zu komponieren, von denen jeder auf dem vorherigen aufbaut, stellt eine ganz andere dar. DeepSeek V4.1 Flash konnte die allgemeinen Formen von Bermans Gesicht identifizieren und breite Farbfelder anlegen. Womit es jedoch zu kämpfen hatte, war die iterative, schichtweise Anwendung von Details.

Berman hob diese Einschränkung hervor, indem er sie Astra, dem multimodalen System von Google, gegenüberstellte. Astra demonstrierte ein ausgefeiltes Verständnis dafür, wie sich überlappende Pinselstriche subtile Schattierungen und komplexe Texturen erzeugen lassen. DeepSeek V4.1 Flash hingegen lieferte eine „sehr abstrakte“ Wiedergabe, der es an der für Details wesentlichen nuancierten Schichtung fehlte.

Hier geht es nicht nur um das Erkennen eines Gesichts, sondern um spatial planning (räumliche Planung) und recursive visual feedback (rekursives visuelles Feedback). Um erfolgreich ein Porträt mit einer GUI zu malen, muss ein Agent:

  • Werkzeuge präzise steuern
  • Leinwandkoordinaten verfolgen
  • Die Wirkung jedes Strichs bewerten
  • Nachfolgende Aktionen basierend auf diesem Feedback planen

Ohne diesen komplexen Kreislauf greift der Agent auf einfachere, gröbere Gesten zurück. Weitere Informationen zu den Fähigkeiten und der Architektur der Modelle finden Sie auf der DeepSeek Official Website. DeepSeek V4.1 Flash stieß, trotz beeindruckender Geschwindigkeit und grundlegender Werkzeugnutzung, an seine Grenzen, als komplexe, iterative Kompositionen erforderlich waren – was eine aktuelle Grenze bei agentischen motorischen Fähigkeiten aufzeigt.

Gefällt Ihnen der Artikel? Erhalten Sie jeden Morgen einen wie diesen per E-Mail.

eine E-Mail pro Tag · Abmeldung mit zwei Klicks · kein Tracking durch Dritte

Die wichtigere Lektion für KI-Agenten

Das Experiment mit DeepSeek V4.1 Flash verdeutlicht einen entscheidenden Unterschied bei KI-Fähigkeiten. Direkte Bildsynthese, wie sie von Midjourney oder Recraft stammt, generiert Pixel aus einem Prompt. Agentisches Handeln erfordert jedoch, dass eine KI eine echte Benutzeroberfläche bedient und sequenzielle Entscheidungen trifft, um ein Ziel zu erreichen. DeepSeek musste ein Referenzbild beobachten und dies dann in browserbasierte Befehle für ein Programm wie JS Paint übersetzen.

Dies macht die Malaufgabe zu einem wirkungsvollen Stresstest für Computer-Use-Systeme. Im Gegensatz zu einer Textantwort offenbart das visuelle Ergebnis eines Agenten, der eine GUI manipuliert, sofort Lücken in der Planung und Ausführung. Wir können genau sehen, wo das Modell Schwierigkeiten hatte, sein Verständnis in präzise, iterative Striche umzusetzen, was ein klareres diagnostisches Feedback bietet als eine perfekt aussehende, aber inhaltlich fehlerhafte Textantwort.

DeepSeeks Versuch zeigt eine beeindruckende grundlegende Interaktion mit Werkzeugen. Es erfasste die grundlegende Aufgabe und erstellte ein erkennbares, wenn auch abstraktes Porträt. Dennoch bleibt die Herausforderung detaillierter, iterativer Arbeit – wie das Schichten von Strichen zum Aufbau von Schattierungen und Texturen – eine hohe Hürde für aktuelle agentic AI-Modelle. Das Experiment unterstreicht die Komplexität, hochgradige Absichten in granulare, reale Schnittstellenaktionen umzusetzen.

Häufig gestellte Fragen

Was hat DeepSeek V4.1 Flash beim Porträttest getan?

Es nutzte eine browserbasierte Microsoft Paint-Nachbildung, um ein Porträt anhand eines Referenzbildes zu erstellen.

Wie sah das DeepSeek-Porträt aus?

Das Ergebnis war stilisiert und abstrakt; es erfasste grobe Formen und Farben, ließ jedoch feine Details vermissen.

Warum war das Porträt weniger detailliert als das von Astra?

Der Test verdeutlichte die Schwierigkeit von DeepSeek, viele präzise Pinselstriche zu planen und zu schichten, um Schattierungen und Texturen aufzubauen.

Ist das Malen mit einem KI-Agenten dasselbe wie Text-to-Image-Generierung?

Nein. Ein Agent muss eine Zeichenoberfläche durch sequenzielle Aktionen bedienen, während ein Text-to-Image-Modell ein Bild direkt generiert.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Für Builder

Diese Seite arbeitet gerade für das Tool von jemand anderem.

KI-Agenten lesen sie. Käufer landen darauf. Sie antwortet in acht Sprachen und über MCP. Dein Tool kann so eine haben — in 24 Stunden live.