Портрет становится тестом на использование компьютера
Мэттью Берман устроил DeepSeek V4.1 Flash необычный тест: воссоздать портрет не путем генерации пикселей, а с помощью веб-версии Microsoft Paint. Это была не стандартная задача диффузионной генерации по промпту; мультимодальной модели пришлось переводить визуальный ввод в последовательность действий на холсте.
Задача требовала большего, чем просто распознавание изображений. DeepSeek V4.1 Flash должен был выбирать цвета, размер кисти и наносить мазки на цифровой холст. Этот эксперимент проверял способность модели интерпретировать визуальный образец, а затем выполнять точные действия с помощью инструментов.
Может ли быстрая мультимодальная модель, такая как DeepSeek V4.1 Flash, создать связное изображение, управляя инструментом, а не синтезируя его напрямую? Настройка Бермана была нацелена на то, чтобы определить, могут ли агентные модели выйти за пределы генерации изображений в латентном пространстве в область GUI interaction, используя растровый графический редактор для «рисования» портрета.
Этот тест расширил границы computer use для ИИ, оценивая, может ли модель трансформировать визуальное понимание в скоординированную серию кликов мыши и движений кисти в виртуальной среде. Он задал вопрос, может ли агент по-настоящему «видеть», а затем «действовать» для достижения желаемого визуального результата.
Результат: узнаваемо, но поразительно абстрактно
Вердикт Бермана относительно усилий DeepSeek V4.1 Flash был «на самом деле неплохо» — удивительно позитивная оценка, учитывая сложность задачи. Однако полученный портрет был крайне стилизованным и абстрактным, передающим скорее впечатление, чем сходство. Он передавал общие формы и цветовую палитру, но ему не хватало мелких деталей и текстурных нюансов исходного изображения.
DeepSeek V4.1 Flash создал узнаваемую форму головы и общее цветовое впечатление, но не смог воспроизвести более мелкие черты, такие как глаза, нос или рот, с какой-либо точностью. Отсутствие убедительной текстуры сделало изображение плоским, скорее абстрактной интерпретацией, чем детальным воссозданием. Этот результат подчеркнул критическое ограничение в подходе модели к визуальным задачам, управляемым через GUI.
Наблюдая за видео, видно, что модель явно испытывала трудности с техникой итеративного наслоения, обычной для цифровой живописи, выполняемой человеком. В отличие от таких систем, как Astra, которая использует последовательные перекрывающиеся мазки кисти для создания теней и текстуры, DeepSeek V4.1 Flash генерировал широкие, упрощенные формы. Такое механическое исполнение привело к созданию портрета, который, будучи узнаваемым, лишен сложных деталей.
Эксперимент был не тестом общих способностей DeepSeek к созданию изображений, а скорее проверкой его способности переводить визуальное наблюдение в точные последовательные действия в среде растровой графики. Результат подчеркнул разрыв в агентном моторном контроле и пространственно-временном мышлении, выявив текущий потолок для более мелких и быстрых моделей уровня «Flash» в сложных, детализированных взаимодействиях.
Почему наслоение оказалось самой сложной частью
Нанесение одного мазка на цифровой холст — это одна задача; создание сотен мазков, где каждый опирается на предыдущий, — совсем другая. DeepSeek V4.1 Flash мог определить общие формы лица Бермана и наложить широкие цветовые поля. С чем он действительно столкнулся, так это с итеративным, послойным добавлением деталей.
Берман подчеркнул это ограничение, противопоставив его Astra, мультимодальной системе Google. Astra продемонстрировала глубокое понимание того, как наложение мазков кисти может создавать тонкую растушевку и сложные текстуры. DeepSeek V4.1 Flash, напротив, выдал «очень абстрактную» интерпретацию, в которой отсутствовала нюансированная многослойность, необходимая для детализации.
Речь идет не просто о распознавании лица; это вопрос пространственного планирования и рекурсивной визуальной обратной связи. Чтобы успешно нарисовать портрет с помощью графического интерфейса (GUI), агент должен:
- Точно управлять инструментами
- Отслеживать координаты холста
- Оценивать влияние каждого мазка
- Планировать последующие действия на основе этой обратной связи
Без этого сложного цикла агент переходит к более простым и широким жестам. Подробнее о возможностях и архитектуре моделей можно узнать на официальном сайте DeepSeek. DeepSeek V4.1 Flash, несмотря на впечатляющую скорость и базовое использование инструментов, столкнулся с трудностями там, где требовалась сложная итеративная композиция, что выявило текущий предел моторных навыков агентов.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Важный урок для ИИ-агентов
Эксперимент с DeepSeek V4.1 Flash подчеркивает критическое различие в возможностях ИИ. Прямой синтез изображений, как в Midjourney или Recraft, создает пиксели на основе промпта. Однако агентное действие требует от ИИ навигации по реальному интерфейсу и принятия последовательных решений для достижения цели. DeepSeek должен был изучить эталонное изображение, а затем перевести его в команды браузера для такой программы, как JS Paint.
Это делает задачу рисования мощным стресс-тестом для систем компьютерного управления. В отличие от текстового ответа, визуальный результат работы агента в GUI сразу обнажает пробелы в планировании и исполнении. Мы можем точно увидеть, где модель не справилась с переводом своего понимания в точные итеративные мазки, что дает более четкую диагностическую обратную связь, чем идеально выглядящий, но внутренне ошибочный текстовый ответ.
Попытка DeepSeek демонстрирует впечатляющее базовое взаимодействие с инструментами. Модель поняла фундаментальную задачу, создав узнаваемый, пусть и абстрактный, портрет. Тем не менее, задача детальной итеративной работы — например, наслоение мазков для создания теней и текстуры — остается сложной планкой для современных моделей агентного ИИ. Эксперимент подчеркивает сложность преобразования высокоуровневого намерения в детализированные действия в реальном интерфейсе.
Часто задаваемые вопросы
Что делал DeepSeek V4.1 Flash в тесте с портретом?
Он использовал браузерную копию Microsoft Paint для создания портрета на основе эталонного изображения.
Как выглядел портрет от DeepSeek?
Результат был стилизованным и абстрактным: он передавал общие формы и цвета, но ему не хватало мелких деталей.
Почему портрет был менее детализированным, чем у Astra?
Тест выявил трудности DeepSeek в планировании и наслоении множества точных мазков кисти для создания теней и текстуры.
Рисование с помощью ИИ-агента — это то же самое, что генерация текста в изображение?
Нет. Агент должен управлять интерфейсом рисования посредством последовательных действий, в то время как модель «текст-в-изображение» генерирует изображение напрямую.

