Навчання ШІ на основі добросовісного використання виглядає хитким, коли працівники самих компаній називають його «приголомшливою крадіжкою»
Основні тези
- Кілька американських медіакомпаній, зокрема The New York Times, вимагають від OpenAI і Microsoft мільярди доларів відшкодування збитків через ймовірне порушення авторських прав під час навчання ШІ.
- Позивачі посилаються на внутрішні повідомлення та свідчення під присягою, у яких керівники поставили під сумнів власний захист на основі добросовісного використання та описали чат-боти як замінники оригінальної журналістики.
- У позові також стверджується, що OpenAI систематично обходила платні доступи, порушувала умови ліцензій на навчальні дані та застосовувала фільтри для приховування доказів після подання позовів.
У новому судовому документі The New York Times та інші позивачі посилаються на раніше не оприлюднені внутрішні електронні листи й свідчення під присягою керівників OpenAI та Microsoft.
The New York Times та кілька інших медіакомпаній подали спільний меморандум на підтримку клопотання про винесення рішення в порядку спрощеного провадження до окружного суду США в Нью-Йорку. До The Times приєдналася група Daily News, до якої входять Chicago Tribune і Denver Post, а також Ziff Davis, якій належать CNET, IGN і PCMag. Серед позивачів також Center for Investigative Reporting, до складу якого входить Mother Jones, і The Intercept.
Позивачі вимагають мільярди доларів відшкодування збитків, повідомляє Financial Times. 92-сторінковий документ є частиною об’єднаного багатоокружного судового провадження, у якому зведено кілька позовів, починаючи з позову New York Times, поданого в грудні 2023 року.
Внутрішні заяви керівників підривають захист на основі добросовісного використання
У документі використано внутрішні електронні листи, повідомлення в Slack і свідчення під присягою, розкриті під час збору доказів, зокрема заяви, що підривають захист ШІ-компаній на основі добросовісного використання.
Директор із прикладних досліджень Microsoft Брент Хехт назвав цю практику «приголомшливою крадіжкою безпрецедентного масштабу» і, можливо, «найбільшою крадіжкою праці в історії людства». Він також написав, що успішний захист на основі добросовісного використання, ймовірно, «повністю висміяв би саму ідею “добросовісного використання”». Microsoft заявила Financial Times, що ці коментарі «відображають особисту позицію одного співробітника» і «не є юридичним аналізом».
Бюро авторських прав США також дійшло висновку в травні 2025 року, що добросовісне використання не може застосовуватися в широкому сенсі, зважаючи на величезні масштаби, у яких ШІ-компанії копіюють дані. Посадовця, який керував підготовкою звіту, згодом звільнила адміністрація Трампа.
За даними документа, Нік Турлі, керівник ChatGPT в OpenAI, написав, що видавці стикаються з «екзистенційною загрозою». Він сказав, що продукти «значною мірою є замінниками, крапка», і дедалі більше замінюватимуть пропозиції видавців «у міру вдосконалення». Інженер OpenAI додав: «хоч би наскільки помітно ми показували посилання, користувачі не натискатимуть на них».
Генеральний директор Microsoft Сатья Наделла під присягою підтвердив, що розмови з чат-ботами замінили відвідування першоджерел. У заяві для FT Microsoft повідомила, що його свідчення стосувалися «загальних принципів і змін, які відбуваються в тому, як люди знаходять і споживають інформацію». За словами компанії, це не було «висновком щодо питань авторського права», які є центральними у цій справі.
У внутрішньому документі Microsoft описано самопідсилювальний цикл, який компанія називає «петлею приреченості».
Наша стратегія роботи з контентом для ШІ запустила «петлю приреченості», яка одночасно зашкодить ефективності наших моделей і всьому вебу: вкрай незвично, коли кінцевий продукт загрожує економічним основам своїх ключових постачальників, але саме таку ситуацію ми створили для нашого бізнесу з LLM щодо його «ланцюга постачання контенту».
Власні дані Microsoft показують, що показники переходів за посиланнями в Copilot були значно нижчими, ніж у традиційному пошуку Bing. Для New York Times показники впали на 87–93 відсотки, для групи Daily News — на 83–91 відсоток, а для Ziff Davis — на 51–94 відсотки.
Усередині OpenAI місцеві новини, що є ключовим напрямом діяльності групи Daily News, називали «доволі поширеним запи[том]» у ChatGPT. Інші дослідження також показали, що відповіді чат-ботів різко скорочують трафік до відкритого вебу.
Співзасновник OpenAI Грег Брокман обговорював здатність моделей працювати з новинами у внутрішньому повідомленні.
до речі, ми чудово працюємо з новинами. щоразу, коли я роблю щось генеративне з NYT, здається, модель доволі добре передбачає наступне речення.
Обхід платного доступу та обмеження ліцензій ускладнюють захист OpenAI
Позивачі описують, як OpenAI систематично обходила платний доступ і ігнорувала умови використання. Коли співробітник повідомив Брокману про «хак для обходу платного доступу nytimes», той відповів: «о, чудово». Приблизно у 2017 році Брокман також написав, що його «глибоко мотивують мільярди», які він сподівався заробити завдяки комерціалізації технології OpenAI.
Представник OpenAI у суді заявив, що йому не відомо про жоден метод виявлення контенту за платним доступом у навчальних даних і жодні спроби його видалити. Стандартний процес сканування компанії «не передбачав перевірки ... Умов використання або надання послуг вебсайтів».
Наделла під присягою заявив, що «все, що захищене платним доступом, має бути ліцензоване будь-ким, хто хоче це використовувати». Він сказав, що змусив би OpenAI повторно навчити свої моделі, якби знав, що компанія сканувала контент за платним доступом і використовувала його для навчання.
OpenAI також придбала «New York Times Annotated Corpus» — збірку з 1,8 мільйона статей — через третю сторону. Її ліцензія обмежувала використання «некомерційною мовною освітою, дослідженнями та технологічною розробкою». Співробітники OpenAI знали, що використовувати корпус для навчання моделей «було б недоречно», але все одно зробили це.
Позивачі звинувачують OpenAI у приховуванні доказів і оскаржують усі чотири фактори добросовісного використання
Одразу після подання позовів OpenAI створила фільтр для приховування результатів, які, найімовірніше, були взяті з публікацій позивачів, йдеться в документі. Контент компаній, які не подавали позовів, залишився без змін. Позивачі стверджують, що фільтр створили не для захисту авторських прав, а щоб перешкодити їм збирати докази.
Хехт із Microsoft висловлював занепокоєння, що OpenAI може запровадити такий фільтр, назвавши це «випадковим приховуванням». Він попереджав, що це призведе до того, що «люди, які мають права на контент, матимуть менше можливостей дізнатися, що використовувалося для навчання». Попри це, у документі наведено численні приклади проблемних результатів, коли ChatGPT на запит відтворював точні копії та резюме статей NYT, зокрема матеріалів за платним доступом.
Позивачі також стверджують, що захист на основі добросовісного використання не витримує перевірки за всіма чотирма передбаченими законом факторами. Вони кажуть, що використання є замінювальним і комерційним, а не трансформативним, тоді як статті є творчими творами, що перебувають у центрі захисту авторського права. Відповідачі також копіювали твори повністю, хоча навіть їхні власні експерти визнали, що жоден окремий твір не був необхідним.
Щодо шкоди ринку позивачі вказують на наявні ліцензійні ринки та ті, що можуть реально виникнути. OpenAI і Microsoft уклали ліцензійні угоди з іншими видавцями, як і Amazon, Google, Meta та Perplexity. Однак замість того, щоб платити за контент позивачів, відповідачі взяли його безкоштовно й обмінювалися ним між собою, стверджується в документі.
Функціонування ліцензійного ринку ускладнює обґрунтування добросовісного використання. Відповідачі не можуть переконливо стверджувати, що ліцензування було неможливим, коли вони вже платять іншим видавцям за зіставний контент.
ШІ може створити мільйон статей «рожевого слизу» за 6 800 доларів
Позивачі також оскаржують твердження, що моделі ШІ не конкурують із видавцями, що ще більше підриває захист на основі добросовісного використання. Вони стверджують, що продукти OpenAI дають змогу користувачам заповнювати ринок «рожевим слизом» — неякісними, часто плагіатними псевдоновинами. За цінами API OpenAI створення мільйона статей у стилі новин обсягом 500 слів кожна коштує близько 6 800 доларів, без залучення жодного журналіста. У документі згадується Prism News, яка за допомогою лише чотирьох співробітників запустила 200 публікацій, створених ШІ, що видавали себе за місцеві редакції та сайти за інтересами.
У 2024 році OpenAI анонсувала інструмент під назвою «Media Manager», який мав дати видавцям змогу відмовитися від сканування. Згідно з документом, згодом проєкт заморозили.
Позивачі просять суд визнати факт порушення авторських прав і відхилити захист на основі добросовісного використання. Вони також хочуть, щоб під час розрахунку передбачених законом збитків кожну статтю розглядали як окремий твір.
Попередні судові рішення схилялися до добросовісного використання, а Міністерство юстиції США за адміністрації Трампа також стало на бік ШІ-лабораторій. Найімовірніше, OpenAI і Microsoft незабаром представлять свою позицію, зосередившись на добросовісному використанні та трансформативному характері своєї роботи. Внутрішні документи, що тепер стали частиною публічних матеріалів справи, не полегшать їм цю аргументацію.
Новини про ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.