Обучение ИИ на основе добросовестного использования выглядит шатко, когда сотрудники самих компаний называют его «поразительным воровством»
Ключевые моменты
- Несколько американских медиакомпаний, включая The New York Times, требуют от OpenAI и Microsoft выплаты миллиардов долларов в качестве компенсации за предполагаемое нарушение авторских прав при обучении ИИ.
- Истцы ссылаются на внутренние сообщения и показания под присягой, в которых руководители ставили под сомнение собственную защиту на основе добросовестного использования и описывали чат-ботов как замену оригинальной журналистике.
- В иске также утверждается, что OpenAI систематически обходила платный доступ, нарушала условия лицензий на обучающие данные и внедрила фильтры для сокрытия доказательств после подачи исков.
В новом судебном документе, поданном The New York Times и другими истцами, приводятся ранее не раскрывавшиеся внутренние электронные письма и показания под присягой руководителей OpenAI и Microsoft.
The New York Times и несколько других медиакомпаний подали совместное ходатайство о вынесении решения в порядке упрощённого производства в окружной суд США в Нью-Йорке. Вместе с Times истцами выступают группа Daily News, в которую входят Chicago Tribune и Denver Post, а также Ziff Davis, владеющая CNET, IGN и PCMag. В число истцов также входят Center for Investigative Reporting, которому принадлежит Mother Jones, и The Intercept.
Согласно Financial Times, истцы требуют возмещения ущерба на миллиарды долларов. 92-страничный документ является частью объединённого многоокружного судебного разбирательства, в котором рассматривается несколько исков, начиная с иска New York Times, поданного в декабре 2023 года.
Внутренние заявления руководителей подрывают защиту на основе добросовестного использования
В документе используются внутренние электронные письма, сообщения в Slack и показания под присягой, раскрытые в ходе сбора доказательств, включая заявления, подрывающие защиту компаний в сфере ИИ на основе добросовестного использования.
Директор Microsoft по прикладным исследованиям Брент Хехт назвал эту практику «потрясающей кражей беспрецедентных масштабов» и, возможно, «крупнейшей кражей труда в истории человечества». Он также написал, что успешная защита на основе добросовестного использования, возможно, «полностью высмеяла бы саму идею „добросовестного использования“». В Microsoft заявили Financial Times, что эти комментарии «отражают личную точку зрения одного сотрудника» и «не являются юридическим анализом».
Бюро авторских прав США также пришло к выводу в мае 2025 года, что добросовестное использование не может применяться в широком масштабе, учитывая огромные объёмы копирования данных компаниями, занимающимися ИИ. Руководитель, курировавший подготовку отчёта, впоследствии был уволен администрацией Трампа.
Согласно документу, Ник Тёрли, руководитель ChatGPT в OpenAI, написал, что издатели сталкиваются с «экзистенциальной угрозой». Он заявил, что продукты «в значительной степени являются заменой, и точка» и будут всё чаще вытеснять предложения издателей «по мере своего улучшения». Инженер OpenAI добавил: «неважно, насколько заметно мы показываем ссылки, пользователи не будут по ним переходить».
Генеральный директор Microsoft Сатья Наделла под присягой подтвердил, что разговоры с чат-ботами заменили посещение первоисточников. В заявлении для FT Microsoft сообщила, что его показания касались «общих принципов и происходящих изменений в том, как люди находят и потребляют информацию». По словам компании, это не было «выводом по вопросам авторского права», лежащим в основе дела.
Во внутреннем документе Microsoft описывается самоподдерживающийся цикл, который компания называет «петлёй обречённости».
Наша стратегия в отношении контента для ИИ запустила «петлю обречённости», которая одновременно ухудшит эффективность наших моделей и состояние всего интернета: крайне необычно, когда конечный продукт угрожает экономическим основам своих важнейших поставщиков, но именно такую ситуацию мы создали для нашего бизнеса LLM в отношении его «цепочки поставок контента».
Собственные данные Microsoft показывают, что показатели переходов по ссылкам в Copilot были гораздо ниже, чем в традиционном поиске Bing. Для New York Times показатели снизились на 87–93%, для группы Daily News — на 83–91%, а для Ziff Davis — на 51–94%.
Внутри OpenAI местные новости, являющиеся ключевым направлением бизнеса группы Daily News, описывались как «довольно распространённый запрос» в ChatGPT. Другие исследования также показали, что ответы чат-ботов резко сокращают трафик в открытом интернете.
Сооснователь OpenAI Грег Брокман обсуждал способность моделей работать с новостями во внутреннем сообщении.
кстати, мы отлично справляемся с новостями. каждый раз, когда я занимаюсь чем-либо генеративным на NYT, кажется, что модель довольно хорошо предсказывает следующее предложение.
Обход платного доступа и ограничения лицензий усложняют защиту OpenAI
Истцы описывают, как OpenAI систематически обходила платный доступ и игнорировала условия использования. Когда сотрудник сообщил Брокману о «способе обойти платный доступ nytimes», тот ответил: «о, отлично». Примерно в 2017 году Брокман также написал, что его «глубоко мотивируют миллиарды», которые он надеялся заработать, коммерциализируя технологии OpenAI.
Представитель OpenAI в суде заявил, что ему неизвестен какой-либо метод обнаружения материалов, защищённых платным доступом, в обучающих данных, а также какие-либо попытки удалить их. Стандартный процесс сканирования компании «не включал проверку ... Условий использования или предоставления услуг веб-сайтов».
Наделла под присягой заявил, что «всё, что защищено платным доступом, должно лицензироваться любым, кто хочет этим пользоваться». Он сказал, что заставил бы OpenAI переобучить модели, если бы знал, что компания собирала материалы, защищённые платным доступом, и использовала их для обучения.
OpenAI также приобрела «New York Times Annotated Corpus» — коллекцию из 1,8 млн статей — через третью сторону. Лицензия ограничивала использование «некоммерческим лингвистическим образованием, исследованиями и разработкой технологий». Сотрудники OpenAI знали, что использование корпуса для обучения моделей «будет неуместным», но всё равно сделали это.
Истцы обвиняют OpenAI в сокрытии доказательств и оспаривают все четыре фактора добросовестного использования
Сразу после подачи исков OpenAI создала фильтр для подавления результатов, которые, скорее всего, были взяты из публикаций истцов, говорится в документе. Контент компаний, не подавших иски, не затрагивался. Истцы утверждают, что фильтр был разработан не для защиты авторских прав, а для того, чтобы помешать им собирать доказательства.
Хехт из Microsoft выражал обеспокоенность тем, что OpenAI может внедрить такой фильтр, назвав его «непреднамеренным сокрытием». Он предупреждал, что это приведёт к тому, что «люди, имеющие права на контент, будут хуже понимать, что использовалось для обучения». Тем не менее в документе приводятся многочисленные примеры проблемных результатов: ChatGPT по запросу воспроизводил точные копии и резюме статей NYT, включая материалы, защищённые платным доступом.
Истцы также утверждают, что защита на основе добросовестного использования не выдерживает проверки по всем четырём установленным законом факторам. По их словам, использование носит замещающий и коммерческий, а не преобразующий характер, тогда как статьи являются выразительными произведениями, находящимися в самом центре охраны авторского права. Ответчики также копировали произведения целиком, хотя даже их собственные эксперты признали, что ни одно отдельное произведение не было необходимым.
Говоря о вреде для рынка, истцы указывают на уже существующие рынки лицензирования и те, которые реально могут сформироваться. OpenAI и Microsoft заключили лицензионные соглашения с другими издателями, как и Amazon, Google, Meta и Perplexity. Однако вместо того чтобы платить за контент истцов, ответчики забрали его бесплатно и обменивались им друг с другом, утверждается в документе.
Функционирующий рынок лицензирования затрудняет защиту на основе добросовестного использования. Ответчики не могут убедительно утверждать, что лицензирование было невозможным, если они уже платят другим издателям за сопоставимый контент.
ИИ может создать миллион статей в стиле «розовой слизи» за 6800 долларов
Истцы также оспаривают утверждение, что модели ИИ не конкурируют с издателями, что ещё сильнее подрывает защиту на основе добросовестного использования. Они утверждают, что продукты OpenAI позволяют пользователям наводнить рынок «розовой слизью» — некачественными, часто плагиатными псевдоновостями. При тарифах API OpenAI создание миллиона новостных статей объёмом по 500 слов стоит около 6800 долларов и не требует участия ни одного журналиста. В документе упоминается Prism News, которая использовала всего четырёх сотрудников для работы 200 публикаций, созданных ИИ и выдававших себя за местные редакции и сайты любителей.
В 2024 году OpenAI объявила об инструменте под названием «Media Manager», который должен был позволить издателям отказаться от сканирования. Согласно документу, с тех пор проект был заморожен.
Истцы просят суд признать нарушение авторских прав и отклонить защиту на основе добросовестного использования. Они также хотят, чтобы при расчёте установленной законом компенсации каждая статья рассматривалась как отдельное произведение.
Предыдущие судебные решения склонялись в пользу добросовестного использования, а Министерство юстиции США при администрации Трампа также поддержало компании, занимающиеся ИИ. Вероятно, OpenAI и Microsoft вскоре представят свою позицию, сосредоточившись на добросовестном использовании и преобразующем характере своей работы. Внутренние документы, оказавшиеся в открытом доступе, теперь не сделают этот аргумент убедительнее.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER и получите чтение без рекламы, еженедельную рассылку об ИИ, эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.