Руководитель Microsoft назвал сбор данных ИИ «крупнейшей кражей труда в истории человечества», свидетельствуют новые неотредактированные судебные документы
Новая неотредактированная информация по иску о нарушении авторских прав, который The New York Times подала против OpenAI и Microsoft три года назад, раскрывает признание того, что сбор данных ИИ был равносилен краже, а продукты на основе ИИ представляют серьезную угрозу для издательских компаний.
Согласно иску, один из топ-менеджеров Microsoft в частном порядке назвал практику компаний по обучению ИИ «кражей», а руководство OpenAI заявило, что собственные модели компании представляют «экзистенциальную угрозу» для издателей и журналистов, чьи материалы использовались для их обучения.
В рассекреченных материалах также подробно описывается, как компании якобы получали и использовали этот контент, незаметно обходя платный доступ, создавая наборы данных для обучения путем массового скрейпинга и намеренно удаляя уведомления об авторских правах из обучающих данных.
Стоит отметить, что значительная часть новой информации взята из собственного меморандума The Times, а не из первичных приложений к делу, которые остаются засекреченными. Приведенные ниже цитаты представлены без исходного контекста.
Новая неотредактированная версия судебного документа стала последним витком эскалации в трехлетнем разбирательстве, в рамках которого The New York Times изначально обвинила компании в нарушении авторских прав из-за обучения генеративных моделей ИИ на ее контенте.
На вопрос о том, могут ли компании, занимающиеся ИИ, законно использовать защищенные авторским правом материалы для обучения ИИ, нет однозначного ответа, однако судьи в основном благосклонно воспринимали аргументы компаний, занимающихся ИИ, о том, что обучение представляет собой «добросовестное использование». Это правовая норма, позволяющая использовать защищенное авторским правом произведение без разрешения в определенных случаях — например, для пародии, освещения новостей или критики. Ранее в этом месяце администрация Трампа представила меморандум в защиту использования OpenAI материалов, защищенных авторским правом, без лицензии для обучения своих больших языковых моделей.
Однако некоторые из новых признаний противоречат защите OpenAI, основанной на принципе добросовестного использования, особенно требованию о том, чтобы использование не подменяло оригинальное произведение и не наносило ущерба его рынку.
Например, собственные данные Microsoft показывают, что «движок ответов» Copilot привел к падению показателей переходов на домен The New York Times на целых 93% по сравнению с традиционным поиском Bing. Во внутренней презентации, подготовленной директором Microsoft по прикладным наукам Брентом Хехтом в январе 2024 года, это снижение описывается как «порочный круг», который «одновременно ухудшит эффективность наших моделей и состояние всего интернета».
«Крайне необычно, когда конечный продукт угрожает экономическим основам своих ключевых поставщиков, но именно в таком положении мы оказались, создав для нашего бизнеса LLM такую “цепочку поставок контента”», — говорится в документе Microsoft, цитируемом в судебном документе.
Генеральный директор Microsoft Сатья Наделла также заявил на допросе в рамках судебного разбирательства ранее в этом году, что «любой контент, доступ к которому ограничен платной подпиской, должен лицензироваться всеми, кто хочет использовать его… для дополнения контекста или обучения», и ясно дал понять, что, если бы «знал, что OpenAI собирала и использовала для обучения информацию, защищенную платным доступом», он бы «воспользовался [правом Microsoft] потребовать от OpenAI переобучить модели».
Другие признания противоречат иным основополагающим критериям добросовестного использования: глава ChatGPT в OpenAI Ник Турли написал во внутренней переписке, что издателям угрожает «экзистенциальная угроза» со стороны таких продуктов, как чат-бот, которые «в значительной степени заменяют [их]» и «будут становиться все более замещающими по мере совершенствования».
Президент OpenAI Грег Брокман назвал модели «превосходными в работе с новостями». Ранее в этом году Наделла под присягой согласился с тем, что общение с чат-ботами «заменило… получение информации непосредственно на веб-сайте через платформу ИИ вместо необходимости переходить к первоисточнику».
Подобные формулировки указывают на то, что технология может напрямую конкурировать с оригинальным произведением, а не преобразовывать его.
В одном из документов Microsoft говорится о «реальном риске» того, что генеративный ИИ может «существенно нарушить занятость тех самых людей, которые создали данные, на которых обучалась базовая модель».
Масштаб копирования поражает. Из документов впервые становится известно, что одни только наборы данных OpenAI, использовавшиеся на промежуточном этапе обучения, содержат более 91 692 копий произведений, опубликованных NYT, Daily News и Center for Investigative Reporting. В одном из наборов данных, созданном на основе Common Crawl, содержалось более 2 миллионов документов только с сайта nytimes.com.
Во внутренней записке от января 2023 года Хехт назвал это «поразительной кражей беспрецедентного масштаба» и «крупнейшей кражей труда в истории человечества».
В судебном документе подробно описывается, как OpenAI и Microsoft получали контент истцов, в том числе собирая его из индекса Bing.
«OpenAI передала Microsoft весь набор данных для обучения GPT-3, который Microsoft использовала для оценки способов внедрения моделей OpenAI в собственные коммерческие продукты, — говорится в судебном документе. — Аналогичным образом Microsoft передавала OpenAI обучающие данные в рамках инициатив под названием Project Taxi и Project Mango».
Компании якобы объединили данные Project Mango в набор для обучения, содержащий копии как минимум 160 903 уникальных произведений новостных издателей.
Чтобы извлечь максимальную пользу из скрейпинга, сотрудники OpenAI якобы разработали план незаметного обхода платного доступа. Из судебных документов следует, что, когда исследователь OpenAI Ник Райдер сообщил Брокману о «лазейке для обхода платного доступа nytimes», Брокман ответил: «а, отлично».
Сотрудники OpenAI также якобы создавали такие наборы данных для обучения, как WebText и WebText2, которые в непропорционально большой степени опирались на собранный новостной контент. Кроме того, они якобы извлекли миллионы статей из Common Crawl — бесплатного открытого репозитория данных веб-скрейпинга. В материалах также описываются преднамеренные попытки удалить уведомления об авторских правах из обучающих данных до их передачи модели, поскольку исследователи «не хотели, чтобы модель выдавала» пользователям «уведомления об авторских правах».
OpenAI и Microsoft не ответили на запросы о комментариях.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.