Skip to content
ai agents

DeepSeek попытался рисовать — и уперся в стену

Эксперимент с портретом превращает простую задачу в браузере в показательный тест способности ИИ видеть, планировать и действовать. Удивительный разрыв заключается не только в художественном вкусе — дело в том, что происходит, когда модели приходится создавать изображение по одному мазку за раз.

Sol Aguirre
DeepSeek попытался рисовать — и уперся в стену

Портрет становится тестом на использование компьютера

Мэттью Берман устроил DeepSeek V4.1 Flash необычный тест: воссоздать портрет не путем генерации пикселей, а с помощью веб-версии Microsoft Paint. Это была не стандартная задача диффузионной генерации по промпту; мультимодальной модели пришлось переводить визуальный ввод в последовательность действий на холсте.

Задача требовала большего, чем просто распознавание изображений. DeepSeek V4.1 Flash должен был выбирать цвета, размер кисти и наносить мазки на цифровой холст. Этот эксперимент проверял способность модели интерпретировать визуальный образец, а затем выполнять точные действия с помощью инструментов.

Может ли быстрая мультимодальная модель, такая как DeepSeek V4.1 Flash, создать связное изображение, управляя инструментом, а не синтезируя его напрямую? Настройка Бермана была нацелена на то, чтобы определить, могут ли агентные модели выйти за пределы генерации изображений в латентном пространстве в область GUI interaction, используя растровый графический редактор для «рисования» портрета.

Этот тест расширил границы computer use для ИИ, оценивая, может ли модель трансформировать визуальное понимание в скоординированную серию кликов мыши и движений кисти в виртуальной среде. Он задал вопрос, может ли агент по-настоящему «видеть», а затем «действовать» для достижения желаемого визуального результата.

Результат: узнаваемо, но поразительно абстрактно

Вердикт Бермана относительно усилий DeepSeek V4.1 Flash был «на самом деле неплохо» — удивительно позитивная оценка, учитывая сложность задачи. Однако полученный портрет был крайне стилизованным и абстрактным, передающим скорее впечатление, чем сходство. Он передавал общие формы и цветовую палитру, но ему не хватало мелких деталей и текстурных нюансов исходного изображения.

DeepSeek V4.1 Flash создал узнаваемую форму головы и общее цветовое впечатление, но не смог воспроизвести более мелкие черты, такие как глаза, нос или рот, с какой-либо точностью. Отсутствие убедительной текстуры сделало изображение плоским, скорее абстрактной интерпретацией, чем детальным воссозданием. Этот результат подчеркнул критическое ограничение в подходе модели к визуальным задачам, управляемым через GUI.

Наблюдая за видео, видно, что модель явно испытывала трудности с техникой итеративного наслоения, обычной для цифровой живописи, выполняемой человеком. В отличие от таких систем, как Astra, которая использует последовательные перекрывающиеся мазки кисти для создания теней и текстуры, DeepSeek V4.1 Flash генерировал широкие, упрощенные формы. Такое механическое исполнение привело к созданию портрета, который, будучи узнаваемым, лишен сложных деталей.

Эксперимент был не тестом общих способностей DeepSeek к созданию изображений, а скорее проверкой его способности переводить визуальное наблюдение в точные последовательные действия в среде растровой графики. Результат подчеркнул разрыв в агентном моторном контроле и пространственно-временном мышлении, выявив текущий потолок для более мелких и быстрых моделей уровня «Flash» в сложных, детализированных взаимодействиях.

Почему наслоение оказалось самой сложной частью

Нанесение одного мазка на цифровой холст — это одна задача; создание сотен мазков, где каждый опирается на предыдущий, — совсем другая. DeepSeek V4.1 Flash мог определить общие формы лица Бермана и наложить широкие цветовые поля. С чем он действительно столкнулся, так это с итеративным, послойным добавлением деталей.

Берман подчеркнул это ограничение, противопоставив его Astra, мультимодальной системе Google. Astra продемонстрировала глубокое понимание того, как наложение мазков кисти может создавать тонкую растушевку и сложные текстуры. DeepSeek V4.1 Flash, напротив, выдал «очень абстрактную» интерпретацию, в которой отсутствовала нюансированная многослойность, необходимая для детализации.

Речь идет не просто о распознавании лица; это вопрос пространственного планирования и рекурсивной визуальной обратной связи. Чтобы успешно нарисовать портрет с помощью графического интерфейса (GUI), агент должен:

  • Точно управлять инструментами
  • Отслеживать координаты холста
  • Оценивать влияние каждого мазка
  • Планировать последующие действия на основе этой обратной связи

Без этого сложного цикла агент переходит к более простым и широким жестам. Подробнее о возможностях и архитектуре моделей можно узнать на официальном сайте DeepSeek. DeepSeek V4.1 Flash, несмотря на впечатляющую скорость и базовое использование инструментов, столкнулся с трудностями там, где требовалась сложная итеративная композиция, что выявило текущий предел моторных навыков агентов.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Важный урок для ИИ-агентов

Эксперимент с DeepSeek V4.1 Flash подчеркивает критическое различие в возможностях ИИ. Прямой синтез изображений, как в Midjourney или Recraft, создает пиксели на основе промпта. Однако агентное действие требует от ИИ навигации по реальному интерфейсу и принятия последовательных решений для достижения цели. DeepSeek должен был изучить эталонное изображение, а затем перевести его в команды браузера для такой программы, как JS Paint.

Это делает задачу рисования мощным стресс-тестом для систем компьютерного управления. В отличие от текстового ответа, визуальный результат работы агента в GUI сразу обнажает пробелы в планировании и исполнении. Мы можем точно увидеть, где модель не справилась с переводом своего понимания в точные итеративные мазки, что дает более четкую диагностическую обратную связь, чем идеально выглядящий, но внутренне ошибочный текстовый ответ.

Попытка DeepSeek демонстрирует впечатляющее базовое взаимодействие с инструментами. Модель поняла фундаментальную задачу, создав узнаваемый, пусть и абстрактный, портрет. Тем не менее, задача детальной итеративной работы — например, наслоение мазков для создания теней и текстуры — остается сложной планкой для современных моделей агентного ИИ. Эксперимент подчеркивает сложность преобразования высокоуровневого намерения в детализированные действия в реальном интерфейсе.

Часто задаваемые вопросы

Что делал DeepSeek V4.1 Flash в тесте с портретом?

Он использовал браузерную копию Microsoft Paint для создания портрета на основе эталонного изображения.

Как выглядел портрет от DeepSeek?

Результат был стилизованным и абстрактным: он передавал общие формы и цвета, но ему не хватало мелких деталей.

Почему портрет был менее детализированным, чем у Astra?

Тест выявил трудности DeepSeek в планировании и наслоении множества точных мазков кисти для создания теней и текстуры.

Рисование с помощью ИИ-агента — это то же самое, что генерация текста в изображение?

Нет. Агент должен управлять интерфейсом рисования посредством последовательных действий, в то время как модель «текст-в-изображение» генерирует изображение напрямую.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.