Вопрос на миллиард долларов, на который ИИ не может ответить
Юридический водоворот поглощает генеративный ИИ. Художники и крупные корпорации заявляют о повсеместном нарушении авторских прав, утверждая, что ИИ-фирмы используют огромные массивы их защищенных работ для обучения мощных моделей, от генераторов изображений до текстовых процессоров. Главный вопрос: могут ли истцы доказать, что их защищенное авторским правом искусство напрямую повлияло на результат работы ИИ?
Доказательство такого нарушения сталкивается с неразрешимой проблемой. Интуитивно понятный метод — удаление одного изображения, защищенного авторским правом, из набора обучающих данных и полное переобучение модели с миллиардами параметров с нуля — астрономически дорог. Этот процесс стоит миллионы долларов и тысячи часов работы GPU, что делает его непосильным даже для одного случая, не говоря уже о тысячах.
Теперь новаторское исследование Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) MIT наносит удар. Исследование, освещенное Better Stack, предполагает, что этот метод не просто непрактичен; он может быть фундаментально бесполезным. Может быть математически невозможно окончательно доказать, что модель ИИ «украла» или находилась под влиянием какого-либо отдельного произведения искусства в своем колоссальном наборе для обучения.
По мере того как наборы обучающих данных масштабируются до миллиардов параметров, индивидуальное влияние любого отдельного изображения сводится к неисчислимому шепоту. Это явление, которое исследователи описывают как затухание атрибуции (attribution decay), означает, что отслеживание конкретного влияния становится похожим на поиск одной капли воды в океане, стирая саму концепцию прямого заимствования для юридического доказательства.
Как «диффузионные ансамбли» (diffusion ensembles) раскрыли дело
Чтобы решить монументальную задачу отслеживания влияния отдельных изображений, исследователи MIT разработали остроумное решение: диффузионные ансамбли. Традиционные методы требуют непомерно дорогого полного переобучения модели для оценки влияния удаления одного изображения.
Вместо этого они построили архитектуру из меньших, перекрывающихся компонентов, каждый из которых обучен на разных фрагментах данных. Это позволило исследователям эффективно «отключать» компоненты, которые видели конкретную фотографию, изолируя ее влияние без огромных затрат на переобучение всей массивной модели.
Измерение максимального потенциального влияния изображения стало возможным с помощью контрфактического радиуса (counterfactual radius). Эта метрика количественно определяет, насколько результат работы ИИ отклоняется от оригинала, когда компоненты, которые сталкивались с конкретным обучающим изображением, деактивируются. По сути, она рассчитывает максимально возможную ответственность любого отдельного изображения.
В 24 диффузионных ансамблях, обученных на наборах данных от 256 изображений до более чем 160 000, проявилась последовательная математическая кривая. По мере расширения наборов данных для обучения контрфактический радиус предсказуемо сокращался, доказывая, что влияние отдельных обучающих изображений значительно уменьшается в масштабе. Это делает конкретную художественную атрибуцию математически неуловимой.
Дилемма «затухания атрибуции»
Исследование MIT раскрывает явление, называемое затуханием атрибуции, при котором доказуемая связь между результатом работы генеративного ИИ и его конкретными входными данными для обучения уменьшается после определенного масштаба. Исследователи количественно оценили это с помощью «контрфактического радиуса», измеряя, насколько смещается результат при удалении одного обучающего изображения. Они наблюдали, как этот радиус постоянно сокращается по мере роста наборов данных для обучения с 256 изображений до более чем 160 000, выявляя математическую кривую уменьшающегося влияния.
Что еще более удивительно, этот распад выходит за рамки отдельных изображений. Даже когда исследователи удаляли целый корпус работ художника из больших обучающих ансамблей, последующие результаты работы моделей оставались практически неизменными. Это означает, что после достижения критического масштаба изображение, созданное ИИ, фактически перестает быть «откуда-либо» в математически идентифицируемом смысле.
Эта невозможность отслеживания создает серьезную проблему для устоявшегося закона об авторском праве, особенно в отношении концепции производного произведения. Если изображение, созданное ИИ, невозможно доказательно проследить до какого-либо конкретного исходного материала, может ли оно юридически квалифицироваться как «производное» от защищенного авторским правом контента? Юридические эксперты полагают, что судам могут потребоваться новые правовые рамки, поскольку возможность определить прямое происхождение исчезает. Для более глубокого понимания этих выводов см. When AI art has no author: Study finds generated images often can't be traced to training data | MIT News.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Новые правила авторского права в эпоху ИИ
Новаторское исследование MIT предоставляет мощную защиту разработчикам ИИ, столкнувшимся с судебными исками об авторских правах, фундаментально меняя юридическое поле битвы. Вывод о том, что распад атрибуции (attribution decay) делает математически невозможным проследить связь конкретных входных данных с результатами, особенно в больших диффузионных моделях, ставит под сомнение иски о нарушении прав, основанные исключительно на включении данных в обучающую выборку. Это вынуждает художников и правообладателей стратегически переориентировать свои юридические аргументы, отходя от попыток прямого отслеживания входных данных.
Правовые системы уже адаптируются к этой сложной реальности, и суды все чаще подвергают тщательной проверке подобные иски. Теперь истцы сталкиваются с бременем доказывания существенного сходства (substantial similarity) между конкретным результатом, созданным ИИ, и их оригинальной работой, защищенной авторским правом, выходя за рамки простого факта включения данных в обширный обучающий набор. Это значительно повышает доказательную планку, смещая фокус с процесса обучения модели на прямое сходство сгенерированного результата.
Развивающийся ландшафт требует как контрмер со стороны художников, так и новых нормативно-правовых баз. Такие проекты, как 'Nightshade', предлагают художникам проактивную защиту, незаметно искажая изображения в сети, чтобы нарушить процесс обучения будущих моделей ИИ. Одновременно с этим растут призывы к повсеместному внедрению систем отказа от участия (opt-out), предоставляющих авторам явный контроль над включением их работ в наборы данных ИИ и пересматривающих права создателей в эпоху генеративного ИИ.
Часто задаваемые вопросы
Что такое «распад атрибуции» (attribution decay) в моделях ИИ?
Распад атрибуции — это феномен, выявленный исследователями MIT, при котором чем больше данных используется для обучения генеративной модели ИИ, тем меньшее влияние оказывает любой отдельный пример обучения на конкретный результат, что делает его математически трудноотслеживаемым.
Как исследователи MIT проверяли влияние ИИ-арта без переобучения моделей?
Они разработали метод под названием «диффузионные ансамбли» (diffusion ensembles), обучая множество небольших компонентов модели на перекрывающихся срезах данных. Чтобы проверить влияние изображения, они просто «отключали» компоненты, которые видели это изображение, что является гораздо более эффективным процессом, чем переобучение всей модели целиком.
Что это исследование MIT означает для судебных процессов по поводу ИИ-арта?
Оно значительно усложняет иски, которые опираются на доказательство того, что результат работы ИИ был скопирован с конкретного обучающего изображения. Суды теперь, вероятно, будут больше фокусироваться на том, является ли конкретный результат работы ИИ «существенно схожим» с работой, защищенной авторским правом, а не просто на содержимом обучающих данных.
Может ли искусство, созданное ИИ, быть защищено авторским правом?
Согласно действующему законодательству США, произведения, созданные исключительно ИИ без творческого вклада человека, не могут быть защищены авторским правом. Однако произведения, созданные с помощью ИИ как инструмента, могут быть защищены авторским правом, если автор-человек внес достаточный творческий вклад.

