Skip to content
ai agents

DeepSeekが描画に挑戦—そして直面した壁

あるポートレートの実験が、単純なブラウザ操作をAIの視覚、計画、行動能力を明らかにする試練へと変えました。驚くべきギャップは単なる芸術的センスの問題ではなく、モデルが一度に一筆ずつ画像を構築しなければならないときに何が起こるかという点にあります。

Sol Aguirre
DeepSeekが描画に挑戦—そして直面した壁

ポートレートがコンピュータ操作の試練となる

Matthew Bermanは、DeepSeek V4.1 Flashに対して一風変わったテストを行いました。それは、ピクセルを生成するのではなく、ウェブベースのMicrosoft Paintのレプリカを操作して顔写真を再現するというものです。これは標準的なプロンプトから画像への拡散モデルのタスクではなく、マルチモーダルモデルが視覚入力をキャンバス操作のシーケンスに変換する必要があるものでした。

この課題は単なる画像認識以上のものを要求しました。DeepSeek V4.1 Flashは、色を選択し、ブラシサイズを選び、デジタルキャンバス上にストロークを配置する必要がありました。この実験は、モデルが視覚的なリファレンスを解釈し、ツールを介した正確なアクションを実行する能力を調査するものです。

DeepSeek V4.1 Flashのような高速なマルチモーダルモデルは、直接画像を合成するのではなく、ツールを操作することで一貫した画像を作成できるのでしょうか?Bermanのセットアップは、エージェント型モデルが潜在空間での画像生成を超えて、ラスターグラフィックスエディタを使用してポートレートを「描く」というGUI操作の領域に踏み込めるかどうかを判断することを目的としていました。

このテストはAIのコンピュータ使用の限界を押し広げ、モデルが視覚的理解を仮想環境内でのマウス操作やブラシの動きという一連の調整された動作に変換できるかを評価しました。それは、エージェントが望ましい視覚的結果を生み出すために、真に「見て」から「行動」できるかを問うものでした。

結果:認識可能だが、驚くほど抽象的

DeepSeek V4.1 Flashの取り組みに対するBermanの評価は「実際には悪くない」というもので、この課題を考慮すると驚くほど前向きな評価でした。しかし、完成したポートレートは非常に様式化された抽象的なもので、似顔絵というよりは印象を捉えたものでした。大まかな形状や全体的なカラーパレットは伝わりますが、リファレンス画像のような細部や質感のニュアンスは欠けていました。

DeepSeek V4.1 Flashは認識可能な顔の輪郭と全体的な色の印象を作り出しましたが、目、鼻、口といった細かい特徴を具体的に再現することには失敗しました。説得力のある質感の欠如が画像を平坦なものにしており、詳細な再現というよりは抽象的な解釈となっていました。この出力は、GUI駆動型の視覚タスクに対するアプローチの決定的な限界を浮き彫りにしました。

ビデオを観察すると、モデルは人間が行うデジタルペインティングに共通する反復的なレイヤー技法に明らかに苦戦していました。陰影や質感を構築するために連続的で重なり合うブラシストロークを用いるAstraのようなシステムとは異なり、DeepSeek V4.1 Flashは広範囲で単純な形状を生成しました。この機械的な実行の結果、ポートレートは識別可能ではあるものの、複雑な詳細を欠くものとなりました。

この実験はDeepSeekの一般的な画像生成能力をテストしたものではなく、視覚的な観察をラスターグラフィックス環境内での正確で連続的なアクションに変換する能力をテストしたものです。その結果は、エージェントの運動制御と時空間推論におけるギャップを強調し、複雑で微細な相互作用における、より小型で高速な「Flash」層モデルの現在の限界を明らかにしました。

なぜレイヤー化が難関だったのか

デジタルキャンバス上に単一のストロークを配置することは一つの課題ですが、何百ものストロークを、それぞれを積み重ねて構成することは全く別の課題です。DeepSeek V4.1 FlashはBermanの顔の大まかな形状を特定し、広い色面を配置することはできました。苦戦したのは、詳細を反復的かつ層状に適用するプロセスでした。

Berman氏は、GoogleのマルチモーダルシステムであるAstraと対比させることで、この限界を強調しました。Astraは、重なり合う筆致がどのように微妙な陰影や複雑なテクスチャを生み出すかを高度に理解していることを示しました。対照的に、DeepSeek V4.1 Flashが生成したものは「非常に抽象的」で、詳細な描写に不可欠な繊細なレイヤー表現が欠けていました。

これは単なる顔認識の話ではありません。空間計画(spatial planning)と再帰的な視覚フィードバック(recursive visual feedback)に関するものです。GUIを使用してポートレートをうまく描くには、エージェントが以下を行う必要があります:

  • ツールを正確に制御する
  • キャンバスの座標を追跡する
  • 各ストロークの影響を評価する
  • そのフィードバックに基づいて後続の行動を計画する

この複雑なループがなければ、エージェントはより単純で大まかな動作に頼ることになります。モデルの機能とアーキテクチャの詳細については、DeepSeek公式サイトをご覧ください。DeepSeek V4.1 Flashは、その速度と基本的なツール使用能力において印象的ですが、複雑で反復的な構成が必要とされる場面で壁に突き当たり、エージェントの運動能力における現在の限界を露呈しました。

この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。

1日1通 · 2クリックで解除 · サードパーティのトラッキングなし

AIエージェントにとってのより大きな教訓

DeepSeek V4.1 Flashの実験は、AIの能力における重要な違いを浮き彫りにしています。MidjourneyやRecraftのような直接的な画像合成は、プロンプトからピクセルを生成します。しかし、エージェントによるアクションは、AIが実際のインターフェースを操作し、目標を達成するために連続的な意思決定を行う必要があります。DeepSeekは、参照画像を確認し、それをJS Paintのようなプログラムのためのブラウザベースのコマンドに変換しなければなりませんでした。

このため、描画タスクはコンピュータ使用システムにとって強力なストレステストとなります。テキストによる回答とは異なり、GUIを操作するエージェントの視覚的出力は、計画と実行のギャップを即座に露呈させます。モデルが理解した内容を正確で反復的なストロークに変換するのに苦労した箇所を正確に特定できるため、見た目は完璧でも内部に欠陥があるテキスト回答よりも、明確な診断フィードバックが得られます。

DeepSeekの試みは、印象的な基本的なツール操作を示しています。基本的なタスクを把握し、抽象的ではあるものの認識可能なポートレートを作成しました。しかし、陰影やテクスチャを構築するためにストロークを重ねるような、詳細で反復的な作業という課題は、現在のエージェント型AIモデルにとって依然として高いハードルです。この実験は、高レベルの意図を粒度の細かい現実世界のインターフェース操作に変換することの複雑さを強調しています。

よくある質問

DeepSeek V4.1 Flashはポートレートテストで何をしましたか?

ブラウザベースのMicrosoft Paintのレプリカを使用して、参照画像からポートレートを作成しました。

DeepSeekによるポートレートはどのような見た目でしたか?

結果は様式化された抽象的なもので、大まかな形状や色は捉えていましたが、細かいディテールに欠けていました。

なぜポートレートはAstraよりも詳細ではなかったのですか?

このテストは、陰影やテクスチャを構築するために多数の正確な筆致を計画し、重ね合わせるというDeepSeekの困難さを浮き彫りにしました。

AIエージェントによる描画は、テキストから画像への生成と同じですか?

いいえ。エージェントは連続的なアクションを通じて描画インターフェースを操作する必要がありますが、テキストから画像へのモデルは直接画像を生成します。

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

ビルダーの方へ

このページは、他社のツールのために働いています。

AIエージェントが読み、購入検討層がたどり着きます。8言語とMCP経由で答えます。あなたのツールにも同じページを — 24時間以内に公開。