Керівник Microsoft назвав скрейпінг даних ШІ «найбільшою крадіжкою праці в історії людства», свідчать нові нерозредаговані судові документи
Нова нерозсекречена інформація у позові The New York Times про порушення авторських прав, який газета подала проти OpenAI та Microsoft три роки тому, свідчить про визнання того, що збирання даних ШІ було рівнозначним крадіжці, а продукти на основі ШІ становлять серйозну загрозу для видань.
Згідно з позовом, один із топменеджерів Microsoft у приватній розмові назвав практики компаній щодо навчання ШІ «крадіжкою», а керівництво OpenAI заявило, що її моделі ШІ становлять «екзистенційну загрозу» для видавців і журналістів, чиї роботи використовувалися для їхнього навчання.
У розсекречених матеріалах також детально описано, як компанії, за твердженнями позивача, отримували та використовували цей контент, непомітно обходячи платний доступ, створюючи навчальні набори даних за допомогою масового скрейпінгу та навмисно видаляючи повідомлення про авторські права з навчальних даних.
Варто зазначити, що значна частина нової інформації походить із власної заяви The Times, а не з основних додатків до справи, які залишаються засекреченими. Наведені нижче цитати подано без їхнього початкового контексту.
Нерозредагована заява стала останньою ескалацією у трирічному позові, у якому The New York Times спочатку звинуватила компанії в порушенні законодавства про авторські права через навчання генеративних моделей ШІ на її контенті.
Питання про те, чи можуть компанії, що розробляють ШІ, законно використовувати матеріали, захищені авторським правом, для навчання ШІ, не має однозначної відповіді, але судді здебільшого прихильно ставилися до аргументів компаній у сфері ШІ про те, що навчання є «добросовісним використанням». Це правове правило дозволяє людям використовувати захищені авторським правом твори без дозволу в окремих випадках, як-от пародія, висвітлення новин або критика. На початку цього місяця адміністрація Трампа подала заяву на захист використання OpenAI матеріалів, захищених авторським правом, без ліцензії для навчання своїх великих мовних моделей.
Однак деякі з нових визнань суперечать захисту OpenAI на підставі добросовісного використання, зокрема вимозі цього правила про те, що використання не має замінювати оригінальний твір або шкодити його ринку.
Наприклад, власні дані Microsoft показують, що «рушій відповідей» Copilot призвів до падіння показників переходів на домен The New York Times на цілих 93% порівняно з традиційним пошуком Bing. У внутрішній презентації Microsoft, підготовленій директором із прикладних наук компанії Брентом Хехтом у січні 2024 року, це падіння названо «замкненим колом», яке «водночас погіршить продуктивність наших моделей і всього вебу».
«Вкрай незвично, коли кінцевий продукт загрожує економічним основам своїх ключових постачальників, але саме в такій ситуації ми опинилися, створивши наш бізнес LLM щодо його “ланцюга постачання контенту”», — йдеться в документі Microsoft, процитованому в заяві.
Генеральний директор Microsoft Сатья Наделла також під час дачі показань у рамках допиту на початку цього року заявив, що «все, що захищене платним доступом, має бути ліцензоване будь-ким, хто хоче використовувати це… для доповнення або навчання», і чітко зазначив, що якби він «знав, що OpenAI зібрала та використовувала для навчання інформацію, захищену платним доступом», то «застосував би [право Microsoft вимагати від OpenAI] повторно навчити свої моделі».
Інші визнання суперечать іншим складовим тесту на добросовісне використання: керівник ChatGPT в OpenAI Нік Турлі у внутрішньому листуванні написав, що видавцям загрожує «екзистенційна загроза» з боку таких продуктів, як чатбот, які є «значною мірою замінниками» і «ставатимуть дедалі більшою заміною в міру вдосконалення».
Президент OpenAI Грег Брокман назвав моделі «чудовими в роботі з новинами». На початку цього року Наделла під присягою погодився з тим, що спілкування з чатботами «замінило… отримання інформації безпосередньо на вебсайті через платформу ШІ замість необхідності переходити до першоджерела».
Такі формулювання свідчать про те, що технологія може безпосередньо конкурувати з оригінальним твором, а не трансформувати його.
У документі Microsoft зазначено, що існує «реальний ризик» того, що генеративний ШІ може «суттєво підірвати зайнятість самих людей, які створили дані, на яких навчалася базова модель».
Масштаб копіювання вражає. Документи вперше розкривають, що самі лише набори даних OpenAI для проміжного навчання містять понад 91 692 копії творів, опублікованих NYT, Daily News і Center for Investigative Reporting. Набір даних, створений на основі Common Crawl, містив понад 2 мільйони документів лише з nytimes.com.
У внутрішній записці від січня 2023 року Хехт назвав це «приголомшливою крадіжкою безпрецедентного масштабу» та «найбільшою крадіжкою праці в історії людства».
У заяві нові деталі описують, як OpenAI та Microsoft отримували контент позивачів, зокрема збираючи його з індексу Bing.
«OpenAI передала весь навчальний набір даних GPT-3 компанії Microsoft, яка використала його, щоб оцінити, як інтегрувати моделі OpenAI у власні комерційні продукти», — йдеться в заяві. «Microsoft аналогічно передавала навчальні дані OpenAI через ініціативи під назвами Project Taxi та Project Mango».
Компанії, за твердженнями позивача, об’єднали дані Project Mango у навчальний набір даних, що містить копії щонайменше 160 903 унікальних творів новинних видавців.
Щоб отримати максимальну користь від скрейпінгу, співробітники OpenAI, за твердженнями позивача, розробили план непомітного обходу платного доступу. У матеріалах справи показано, що коли дослідник OpenAI Нік Райдер повідомив Брокману про «спосіб зламати платний доступ nytimes», Брокман відповів: «а, чудово».
Співробітники OpenAI також, за твердженнями позивача, створили навчальні набори даних, як-от WebText і WebText2, які непропорційно значною мірою спиралися на скрейпінг новинного контенту. Вони також нібито витягнули мільйони статей із Common Crawl — безкоштовного відкритого репозиторію даних вебсканування. У висновках також описано навмисні спроби видалити повідомлення про авторські права з навчальних даних до їхнього надходження в модель, оскільки дослідники «не хотіли б, щоб модель виводила» «повідомлення про авторські права» для користувачів.
OpenAI та Microsoft не відповіли на запити про коментар.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.