AIが答えられない10億ドルの問い
生成AIを巡る法的な大混乱が起きている。アーティストや大手企業は、AI企業が画像生成からテキスト処理に至るまで、強力なモデルをトレーニングするために保護された膨大な作品群を悪用していると主張し、広範な著作権侵害を訴えている。核心となる問いは、原告が自身の著作物がAIの出力に直接影響を与えたことを証明できるかという点である。
このような侵害の立証は、解決困難な課題に直面している。直感的な手法である「トレーニングデータセットから単一の著作権画像を削除し、数十億のパラメータを持つモデルをゼロから完全に再トレーニングする」という方法は、天文学的なコストがかかる。このプロセスには数百万ドルと数千時間のGPU時間が必要であり、単一の事例であっても、ましてや数千件もの事例に対しては到底不可能である。
今回、MITのComputer Science and Artificial Intelligence Laboratory (CSAIL)による画期的な研究が衝撃的な事実を突きつけた。Better Stackが強調したこの研究は、この手法が非現実的であるだけでなく、根本的に無意味である可能性を示唆している。AIモデルが巨大なトレーニングセット内の特定の芸術作品を「盗用」した、あるいは影響を受けたことを決定的に証明することは、数学的に不可能である可能性がある。
トレーニングデータセットが数十億のパラメータ規模に拡大するにつれ、単一の画像が与える個別の影響は、定量化不可能なほど微小なものになる。研究者たちが「帰属の減衰(attribution decay)」と呼ぶこの現象は、特定のインフルエンスを追跡することが大海の一滴を探すようなものになり、法的な証明のための直接的な派生という概念そのものを消し去ってしまうことを意味する。
「Diffusion Ensembles」がどのように事件を解明したか
個々の画像の影響を追跡するという途方もない課題に取り組むため、MITの研究者たちは「Diffusion Ensembles」という巧妙な解決策を開発した。従来の手法では、単一画像の削除による影響を評価するために、モデル全体の再トレーニングという法外なコストが必要であった。
その代わりに、彼らはそれぞれ異なるデータセットでトレーニングされた、より小さく重複するコンポーネントのアーキテクチャを構築した。これにより、研究者は特定の写真を見たコンポーネントを効率的に「オフ」にすることができ、巨大なモデル全体を再トレーニングする膨大なコストをかけずに、その影響を分離することが可能となった。
画像の最大潜在的影響を測定することは、「反事実半径(counterfactual radius)」を用いることで可能となった。この指標は、特定のトレーニング画像に遭遇したコンポーネントを無効化した際に、AIの出力がオリジナルからどれだけ乖離したかを定量化したものである。これは本質的に、単一の画像が持つ最大の影響力を計算するものである。
256枚から16万枚以上の画像データセットでトレーニングされた24のDiffusion Ensembles全体で、一貫した数学的曲線が浮かび上がった。トレーニングデータセットが拡大するにつれて、反事実半径は予測通りに縮小し、個々のトレーニング画像の影響が規模に応じて大幅に減少することが証明された。これにより、特定の芸術的帰属を数学的に特定することが困難になっている。
「帰属の減衰」のジレンマ
MITの研究は、生成AIの出力と特定のトレーニング入力との間の実証可能なリンクが、一定の規模を超えると減少する「帰属の減衰(attribution decay)」と呼ばれる現象を明らかにしている。研究者たちは「反事実半径」を用いてこれを定量化し、単一のトレーニング画像を削除した際に出力がどれだけ変化するかを測定した。彼らは、トレーニングデータセットが256枚から16万枚以上に増えるにつれて、この半径が一貫して縮小することを確認し、影響力が減少していく数学的曲線を明らかにした。
さらに驚くべきことに、この減衰は個々の画像を超えて広がっています。研究者が大規模な学習アンサンブルから「あるアーティストの全作品」を削除した場合でさえ、モデルのその後の出力はほとんど変化しませんでした。これは、ある臨界規模を超えると、AIが生成した画像は数学的に識別可能な意味において、実質的に「どこから来たものでもない」状態になることを意味します。
この追跡不可能性は、確立された著作権法、特に「二次的著作物」という概念に対して深刻な課題を突きつけています。もしAI画像が特定のソース素材に遡って証明できない場合、法的に著作権で保護された入力から「派生したもの」と見なすことができるのでしょうか。直接的な系譜を特定する能力が消失するため、法学者は裁判所が新しい枠組みを必要とする可能性があると示唆しています。これらの調査結果の詳細については、When AI art has no author: Study finds generated images often can't be traced to training data | MIT News を参照してください。
この記事が気に入ったら、毎朝同じようなものをメールで受け取れます。
1日1通 · 2クリックで解除 · サードパーティのトラッキングなし
AI著作権の新しいルール
MITの画期的な研究は、著作権訴訟に直面しているAI開発者にとって強力な防御策となり、法的な戦場を根本的に変えています。「帰属の減衰(attribution decay)」により、特に大規模な拡散モデルにおいて特定の入力から出力を追跡することが数学的に不可能であるという発見は、単に学習データに含まれていることだけを根拠とする侵害主張に異議を唱えるものです。これにより、アーティストや著作権者は、直接的な入力追跡から法的な議論を戦略的に転換せざるを得なくなっています。
法制度はこの複雑な現実にすでに対応しつつあり、裁判所は主張をより厳しく精査するようになっています。原告は現在、広大な学習データセットに含まれているというだけではなく、特定のAI生成出力と自身の元の著作物との間に「実質的な類似性」があることを証明する責任を負うことになります。これにより立証のハードルが大幅に上がり、焦点はモデルの学習プロセスから、生成された出力の直接的な類似性へと移っています。
進化する状況下では、アーティスト主導の対抗策と新しい規制の枠組みの両方が必要とされています。「Nightshade」のようなプロジェクトは、オンライン画像を微妙に破損させることで将来のAIモデルの学習を妨害し、アーティストに先制的な防御手段を提供しています。同時に、クリエイターが自身の作品のAIデータセットへの組み込みを明示的に制御できるようにし、生成AI時代におけるクリエイターの権利を再調整するために、普遍的に実装されたオプトアウトシステムを求める声が高まっています。
よくある質問
AIモデルにおける「帰属の減衰(attribution decay)」とは何ですか?
帰属の減衰とは、MITの研究者によって特定された現象で、生成AIモデルの学習データが増えれば増えるほど、単一の学習例が特定の出力に与える影響が小さくなり、数学的に追跡が困難になることを指します。
MITの研究者は、モデルを再学習させることなく、どのようにしてAIアートの影響をテストしたのですか?
彼らは「拡散アンサンブル(diffusion ensembles)」と呼ばれる手法を開発し、重複するデータスライスで多くの小さなモデルコンポーネントを学習させました。画像の影響をテストするために、その画像を見たコンポーネントを単に「オフ」にするという、モデル全体を再学習させるよりもはるかに効率的なプロセスを採用しました。
このMITの研究は、AIアートの訴訟にとって何を意味しますか?
AIの出力が特定の学習画像からコピーされたことを証明することに依存する主張を大幅に複雑にします。裁判所は現在、学習データの内容だけでなく、特定のAI出力が著作物と「実質的に類似」しているかどうかに焦点を当てる可能性が高まっています。
AIが生成したアートは著作権で保護されますか?
現在の米国法の下では、人間の創造的な入力なしにAIのみによって生成された作品は著作権で保護されません。ただし、人間が十分な創造的表現に貢献した場合、AIをツールとして使用して作成された作品は著作権で保護される可能性があります。

