Обучението на ИИ, основано на добросъвестно използване, изглежда несигурно, когато служители на самите компании го наричат „поразителна кражба“
Основни моменти
- Няколко американски медийни компании, включително The New York Times, търсят милиарди долари обезщетение от OpenAI и Microsoft за предполагаемо нарушаване на авторски права при обучението на ИИ.
- Ищците посочват вътрешни съобщения и свидетелски показания под клетва, в които ръководители поставят под въпрос собствената си защита, основана на добросъвестното използване, и описват чатботовете като заместители на оригиналната журналистика.
- В иска също се твърди, че OpenAI систематично е заобикаляла платените стени, нарушавала е лицензионните условия за обучаващи данни и е внедрила филтри за потискане на доказателства след завеждането на делата.
Нов съдебен документ от The New York Times и други ищци цитира досега неразкрити вътрешни имейли и свидетелски показания под клетва от ръководители на OpenAI и Microsoft.
The New York Times и няколко други медийни компании са подали съвместен меморандум в подкрепа на съкратено съдебно решение във Федералния окръжен съд в Ню Йорк. Към Times се присъединява групата Daily News, която включва Chicago Tribune и Denver Post, както и Ziff Davis, собственик на CNET, IGN и PCMag. Сред ищците са също Center for Investigative Reporting, в която влиза Mother Jones, и The Intercept.
Ищците търсят милиарди долари обезщетение, съобщава Financial Times. Меморандумът от 92 страници е част от обединено многодистриктно съдебно производство, което събира няколко дела, започвайки с делото на New York Times, заведено през декември 2023 г.
Вътрешните изявления на ръководители подкопават защитата, основана на добросъвестното използване
Меморандумът се основава на вътрешни имейли, съобщения в Slack и свидетелски показания под клетва, разкрити в хода на събирането на доказателства, включително изявления, които подкопават защитата на компаниите за ИИ, основана на добросъвестното използване.
Директорът по приложна наука на Microsoft Брент Хехт нарича практиката „потресаваща кражба с безпрецедентни мащаби“ и вероятно „най-голямата кражба на труд в човешката история“. Той също така пише, че успешната защита, основана на добросъвестното използване, на практика би „превърнала идеята за „добросъвестно използване“ в пълна подигравка“. Microsoft заяви пред Financial Times, че тези коментари „отразяват личната гледна точка на един служител“ и „не представляват правен анализ“.
Службата за авторски права на САЩ също заключи през май 2025 г., че добросъвестното използване не може да се прилага в широк мащаб предвид огромния обем, в който компаниите за ИИ копират данни. Служителят, ръководил изготвянето на доклада, по-късно беше уволнен от администрацията на Тръмп.
Ник Търли, ръководителят на ChatGPT в OpenAI, е написал, че издателите са изправени пред „екзистенциална заплаха“, според меморандума. Той е заявил, че продуктите „до голяма степен са заместители, точка“ и все повече ще заменят предложенията на издателите „с подобряването си“. Инженер на OpenAI е добавил: „независимо колко ясно показваме връзките, потребителите няма да кликват“.
Главният изпълнителен директор на Microsoft Сатя Надела потвърди под клетва, че разговорите с чатботове са заменили посещенията на оригинални източници. В изявление пред FT Microsoft заяви, че показанията му са засягали „общи принципи и текущи промени в начина, по който хората намират и използват информация“. Компанията посочи, че това не е „заключение по въпросите на авторското право“, които са в центъра на делото.
Вътрешен документ на Microsoft описва самоподсилващ се цикъл, който нарича „спирала на гибелта“.
Нашата стратегия за съдържание с ИИ започна „спирала на гибелта“, която едновременно ще навреди на представянето на моделите ни и на целия интернет: изключително необичайно е краен продукт да застрашава икономическите основи на основните си доставчици, но това е ситуацията, която създадохме за бизнеса си с LLM по отношение на неговата „верига за доставка на съдържание“.
Собствените данни на Microsoft показват, че честотата на кликване в Copilot е била много по-ниска от тази при традиционното търсене в Bing. Показателите са спаднали с 87 до 93 процента за New York Times, с 83 до 91 процента за групата Daily News и с 51 до 94 процента за Ziff Davis.
Вътрешно OpenAI е описвала местните новини — основен бизнес за групата Daily News — като „доста често търсене“ в ChatGPT. Други проучвания също са установили, че отговорите на чатботовете рязко намаляват трафика към отворения интернет.
Съоснователят на OpenAI Грег Брокман е обсъждал способността на моделите да обработват новини във вътрешно съобщение.
между другото сме отлични в новините. всеки път, когато правя каквото и да е генеративно нещо за NYT, изглежда, че предсказва следващото изречение доста добре.
Заобикалянето на платени стени и лицензионните ограничения усложняват защитата на OpenAI
Ищците описват как OpenAI систематично е заобикаляла платени стени и е пренебрегвала условията за ползване. Когато служител казал на Брокман за „хак за заобикаляне на платената стена на nytimes“, той отговорил: „аха, супер“. Около 2017 г. Брокман също е написал, че е „дълбоко мотивиран от газилионите“, които се надявал да спечели чрез комерсиализирането на технологията на OpenAI.
Корпоративният представител на OpenAI е свидетелствал, че не му е известен метод за откриване на съдържание зад платена стена в обучаващите данни, нито усилия за премахването му. Стандартният процес на обхождане на компанията „не включваше преглед на ... Условията за ползване или обслужване на уебсайтовете“.
Надела е свидетелствал под клетва, че „всичко, което е зад платена стена, трябва да бъде лицензирано от всеки, който иска да го използва“. Той е заявил, че би принудил OpenAI да обучи моделите си наново, ако е знаел, че компанията е извличала съдържание зад платена стена и го е използвала за обучение.
OpenAI също така е придобила „New York Times Annotated Corpus“ — колекция от 1,8 милиона статии — чрез трета страна. Лицензът ѝ ограничава използването до „некомерсиално езиково образование, изследвания и технологично развитие“. Служителите на OpenAI са знаели, че използването на корпуса за обучение на модели „няма да е уместно“, но въпреки това са го направили.
Ищците обвиняват OpenAI в потискане на доказателства и оспорват и четирите фактора за добросъвестно използване
Непосредствено след завеждането на делата OpenAI е създала филтър за потискане на резултатите, които най-вероятно са извлечени от публикациите на ищците, според меморандума. Съдържанието от компании, които не са завели дела, е останало незасегнато. Ищците твърдят, че филтърът е бил създаден не за защита на авторските права, а за да им попречи да събират доказателства.
Хехт от Microsoft е изразил опасения, че OpenAI може да внедри такъв филтър, като го е нарекъл „случайно прикриване“. Той е предупредил, че това ще доведе до „по-малка видимост за хората, които имат права върху съдържанието, относно това какво е използвано за обучение“. Въпреки това меморандумът включва множество примери за проблемни резултати, като ChatGPT възпроизвежда точни копия и резюмета на статии от NYT при поискване, включително на статии зад платена стена.
Ищците също така твърдят, че защитата, основана на добросъвестното използване, се проваля и по четирите законови фактора. Те заявяват, че използването е заместително и комерсиално, а не преобразуващо, докато статиите са изразни произведения, които са в основата на защитата на авторските права. Ответниците също са копирали цели произведения, въпреки че собствените им експерти са признали, че не е било необходимо нито едно конкретно произведение.
Що се отнася до вредите за пазара, ищците посочват съществуващите лицензионни пазари и тези, които реалистично биха могли да се развият. OpenAI и Microsoft са подписали лицензионни споразумения с други издатели, както и Amazon, Google, Meta и Perplexity. Но вместо да плащат за съдържанието на ищците, ответниците са го взели безплатно и са го обменяли помежду си, се твърди в меморандума.
Функциониращият лицензионен пазар затруднява поддържането на аргумента за добросъвестно използване. Ответниците не могат убедително да твърдят, че лицензирането не е било възможно, когато вече плащат за сравнимо съдържание от други издатели.
ИИ може да генерира милион статии тип „розова каша“ за 6800 долара
Ищците също оспорват аргумента, че моделите на ИИ не се конкурират с издателите, което допълнително подкопава защитата, основана на добросъвестното използване. Те твърдят, че продуктите на OpenAI позволяват на потребителите да наводнят пазара с „розова каша“ — нискокачествени, често плагиатствани псевдоновини. При цените на API на OpenAI генерирането на един милион статии в новинарски стил с по 500 думи струва около 6800 долара, без участието на нито един журналист. В меморандума се цитира Prism News, която е използвала само четирима служители, за да управлява 200 публикации, генерирани от ИИ, представящи се за местни редакции и сайтове за хобита.
През 2024 г. OpenAI обяви инструмент, наречен „Media Manager“, който трябваше да позволи на издателите да се откажат от обхождането. Според меморандума проектът оттогава е замразен.
Ищците искат от съда да установи нарушение на авторските права и да отхвърли защитата, основана на добросъвестното използване. Те също така искат всяка статия да бъде третирана като отделно произведение при изчисляването на евентуални законови обезщетения.
Предишни съдебни решения са клонели към добросъвестното използване, а Министерството на правосъдието на САЩ при администрацията на Тръмп също е заело страната на лабораториите за ИИ. Вероятно OpenAI и Microsoft скоро ще представят своята позиция, съсредоточена върху добросъвестното използване и преобразуващия характер на работата им. Вътрешните документи, които вече са публично достъпни, няма да улеснят този аргумент.
Новини за ИИ без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за ИИ, нашия ексклузивен шест пъти годишно доклад за водещите разработки „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.