Законно ли обучать модели ИИ на книгах, защищённых авторским правом? Всё сложно
Вам, вероятно, уже известно, что модели ИИ, лежащие в основе ChatGPT, Gemini, Claude и других чат-ботов, обучаются на, казалось бы, бесконечных базах данных опубликованных произведений, содержащих сотни миллионов книг, онлайн-статей, академических работ и практически всего, что можно найти в интернете. Большинство публикующихся авторов без своего ведома или согласия внесли вклад в разработку тех же инструментов ИИ, которые угрожают подорвать их средства к существованию. Это ведь кажется незаконным, верно?
В действительности всё не так просто.
«Я думаю, одна из проблем всей этой области права и всей этой области технологий заключается в том, что здесь происходит очень многое», — рассказала TechCrunch Кэти Геллис, юрист, специализирующаяся на интеллектуальной собственности, авторском праве и технологиях. «Всё очень сложно, и происходящее вызывает сильные эмоции — как у сторонников, так и у противников».
В прошлом году, в одном из первых решений такого рода, судья Уильям Алсап обязал Anthropic выплатить колоссальные $1.5 billion в рамках соглашения по делу об авторских правах группе писателей, чьи произведения использовались для обучения моделей ИИ компании. На первый взгляд это выглядело как моральная победа авторов, однако судья Алсап фактически постановил, что обучение ИИ Anthropic было законным. Алсап наказал Anthropic за пиратское копирование этих книг из нелегальных онлайн-теневых библиотек.
«Подобно любому читателю, мечтающему стать писателем, большие языковые модели Anthropic обучались на произведениях не для того, чтобы обогнать их и воспроизвести или вытеснить их, — а для того, чтобы резко свернуть и создать нечто иное», — написал судья, сравнив то, как большая языковая модель поглощает триллионы слов, с изучением литературы писателем.
Геллис считает, что это решение более выгодно компаниям, занимающимся ИИ. Что такое штраф в размере $1.5 billion для компании, которая, согласно прогнозам, будет получать около $200 billion годовой выручки к 2028 году?
«Я думаю, что для обучения ИИ в целом это хорошая новость: он посмотрел на происходящее и фактически счёл его аналогичным чтению защищённого авторским правом произведения, а не копированию такого произведения», — сказала Геллис. «Авторское право связано с копированием, но оно не связано с использованием произведения, его восприятием, потреблением или чтением».
Закон об авторском праве не обновлялся с 1976 года, а это означает, что судьям приходится выяснять, как интерпретировать правила, которым уже 50 лет, сталкиваясь с юридическими вопросами, способными определить будущее индустрии ИИ.
«Сейчас все очень обеспокоены, потому что законодательство крайне противоречиво, и происходит это из-за данного вопроса», — рассказал TechCrunch Джейсон Хендерсон, старший юрист и основатель практики в области интеллектуальной собственности и медиа в JWL International. «Они знают, что модель ИИ обучалась на огромном количестве материалов, а законодательство пока фактически не успело разобраться с этим вопросом».
Эти вопросы часто упираются в законодательство о добросовестном использовании — а именно в то, является ли использование защищённого авторским правом произведения достаточно «трансформативным», чтобы считаться юридически допустимым.
Добросовестное использование — это исключение из законодательства об авторском праве, разрешающее использовать защищённые авторским правом материалы без явного разрешения, защищая возможность комментировать защищённые авторским правом произведения и развивать их посредством критики, пародии, образования и других средств. Принимая решение о том, является ли использование добросовестным, судьи учитывают конкретные факторы, включая цель и характер произведения, объём использованного материала и его влияние на рынок.
«Авторское право всегда направлено на защиту и расширение рынка», — отметил Хендерсон. «Суды [в делах, связанных с ИИ] рассуждают крайне непоследовательно. Как правило, выигрывает тот, кто обучает свою систему на чьей-то собственности с целью напрямую конкурировать, — тогда суды относятся к этому неодобрительно… Если же ваши действия не приведут к конкуренции, суды обычно находят способы признать их допустимыми».
Хендерсон ссылается на дело, в котором медиа- и технологическая компания Thomson Reuters подала в суд на исследовательскую фирму Ross Intelligence за копирование её контента с целью создания конкурирующей юридической платформы на основе ИИ.
«Использование материалов Ross не является трансформативным, поскольку оно не имеет “дальнейшей цели или иного характера” по сравнению с использованием материалов Thomson Reuters», — написал в прошлом году судья Стефанос Бибас в своём решении.
В этом деле судья Бибас постановил, что обучение на контенте Reuters для создания новой платформы, которая напрямую конкурировала бы с ней, не является добросовестным использованием. Хотя авторы потенциально могли бы утверждать, что чат-боты конкурируют с ними, используя их произведения для создания новых синтетических книг, этот аргумент пока не нашёл поддержки в судах.
Говоря о взаимосвязи ИИ и авторского права, Геллис считает полезным сузить предмет обсуждения — то, как мы рассматриваем авторское право применительно к обучению ИИ, сильно отличается от того, как мы рассматриваем авторские права на контент, созданный ИИ.
В одном из дел, Thaler v. Perlmutter, суд постановил, что произведение, полностью созданное ИИ, не может охраняться авторским правом, что открывает целый ящик Пандоры: как окончательно доказать, было ли произведение создано с использованием ИИ, и если да, то как определить, какая его доля была создана ИИ или при его содействии?
«Если вы пишете роман в [Microsoft] Word и запускаете проверку орфографии, нам в целом комфортно считать, что Word не владеет вашим романом», — сказала Геллис. «[ИИ] заставляет нас взглянуть на целый ряд решений, которые мы какое-то время фактически игнорировали».
Большинство компаний, занимающихся ИИ, по-прежнему вовлечены в незавершённые судебные разбирательства по этим вопросам, а это означает, что окончательного решения этих проблем не будет ещё долго.
«Мы видим, что первые обмены ударами оказывают влияние, причём это влияние может быть нивелировано, если другие суды примут иные решения; а чтобы выяснить, какое из них возобладает, потребуются последующие этапы судебных разбирательств», — сказала Геллис. «Но тем временем все эти решения формируют происходящее. Компаниям, занимающимся ИИ, было бы довольно глупо их игнорировать».
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.