Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Ръководител на Microsoft нарекъл извличането на данни от ИИ „най-голямата кражба на труд в историята на човечеството“, показват нови нецензурирани съдебни документи

Нова нецензурирана информация по делото за авторски права, заведено от The New York Times срещу OpenAI и Microsoft преди три години, разкрива признание, че извличането на данни от изкуствен интелект е равносилно на кражба и че продуктите с изкуствен интелект представляват сериозна заплаха за издателските компании.

Според иска високопоставен ръководител на Microsoft поверително е описал практиките на компаниите за обучение на изкуствен интелект като „кражба“, а ръководството на OpenAI е заявило, че собствените му модели с изкуствен интелект представляват „екзистенциална заплаха“ за издателите и журналистите, чиято работа ги е обучила. 

Разсекретените материали също така описват подробно как компаниите allegedly са получили и използвали това съдържание, като са заобикаляли незабелязано платените стени, изграждали са набори от данни за обучение чрез масово извличане и умишлено са премахвали уведомленията за авторски права от данните за обучение. 

Струва си да се отбележи, че голяма част от новата информация идва от собственото изложение на The Times, а не от основните доказателства, които остават запечатани. Цитатите по-долу са представени без първоначалния им контекст.

Нецензурираният съдебен документ е последната ескалация в тригодишното дело, в което The New York Times първоначално обвини компаниите, че са нарушили закона за авторските права, като са обучавали генеративни модели с изкуствен интелект върху негово съдържание. 

Въпросът дали компаниите за изкуствен интелект могат законно да използват материали, защитени с авторски права, за обучение на изкуствен интелект няма ясен отговор, но съдиите до голяма степен са благосклонни към аргументите на компаниите за изкуствен интелект, че обучението представлява „честна употреба“. Това правно правило позволява на хората да използват защитени с авторски права произведения без разрешение в определени случаи, като например пародия, новинарско отразяване или критика. По-рано този месец администрацията на Тръмп представи становище в защита на използването от OpenAI на защитени с авторски права материали без лиценз за обучение на нейните LLM модели. 

Няколко от новите признания обаче противоречат на защитата на OpenAI, основана на честната употреба, особено на изискването на това правило използването да не замества или да не вреди на пазара за оригиналното произведение.

Например собствените данни на Microsoft показват, че „двигателят за отговори“ Copilot е довел до спад с до 93% на честотата на преминаване към домейна на The New York Times в сравнение с традиционното търсене в Bing. Вътрешна презентация на Microsoft, изготвена от директора по приложни науки на компанията Брент Хехт през януари 2024 г., описва спада като „порочен кръг“, който „едновременно ще навреди на представянето на нашите модели и на цялата мрежа“.

„Изключително необичайно е краен продукт да заплашва икономическите основи на своите ключови доставчици, но това е ситуацията, която създадохме за бизнеса си с LLM по отношение на неговата „верига за доставки на съдържание“, се казва в документа на Microsoft, цитиран в съдебния документ. 

Главният изпълнителен директор на Microsoft Сатя Надела също свидетелства при разпит по-рано тази година, че „всичко, което е зад платена стена, трябва да бъде лицензирано от всеки, който иска да го използва… за извличане на информация или обучение“, и ясно заяви, че ако „беше разбрал, че OpenAI е извличала и обучавала [моделите си] с информация, която е била зад платена стена“, той щеше да „упражни [правото на Microsoft] да изиска от OpenAI да обучи моделите си наново“. 

Други признания противоречат на различни стълбове на теста за честна употреба: ръководителят на ChatGPT в OpenAI Ник Търли е написал във вътрешна комуникация, че издателите са изправени пред „екзистенциална заплаха“ от продукти като чатбота, които са „до голяма степен заместващи“ и „ще стават все по-заместващи, с подобряването си“.

Президентът на OpenAI Грег Брокман е описал моделите като „отлични в новините“. По-рано тази година Надела се съгласи под клетва, че разговарянето с чатботове „е заместило… предоставянето на информацията директно на вас на уебсайта чрез платформата с изкуствен интелект, вместо да е необходимо да отивате до първоизточника“.

Този тип език показва как технологията би могла директно да се конкурира с оригиналното произведение, вместо да го трансформира. 

В документ на Microsoft се посочва, че съществува „реален риск“ генеративният изкуствен интелект да „наруши значително заетостта именно на хората, генерирали данните, върху които е бил обучен базовият модел“. 

Огромният мащаб на копирането е впечатляващ. Документите разкриват за първи път, че само междинните набори от данни за обучение на OpenAI съдържат повече от 91 692 копия на произведения, публикувани от NYT, Daily News и Center for Investigative Reporting. Набор от данни, извлечен от Common Crawl, включва повече от 2 милиона документа само от nytimes.com. 

Във вътрешна бележка от януари 2023 г. Хехт го нарича „потресаваща кражба с безпрецедентни размери“ и „най-голямата кражба на труд в човешката история“.

В съдебния документ се описва подробно как OpenAI и Microsoft са се сдобили със съдържанието на ищците, включително чрез извличането му от индекса на Bing. 

„OpenAI предостави целия набор от данни за обучение на GPT-3 на Microsoft, който Microsoft използва, за да оцени как да внедри моделите на OpenAI в собствените си търговски продукти“, се казва в съдебния документ. „По подобен начин Microsoft предостави данни за обучение на OpenAI чрез инициативи, наречени Project Taxi и Project Mango.“

Компаниите allegedly са събрали данните от Project Mango в набор от данни за обучение, който съдържа копия на най-малко 160 903 уникални произведения от новинарските издатели. 

За да извлекат максимална полза от събирането на данни, служители на OpenAI allegedly са разработили план за заобикаляне на платените стени, без това да бъде засечено. От съдебните документи става ясно, че когато изследователят на OpenAI Ник Райдър е казал на Брокман за „хак за заобикаляне на платената стена на nytimes“, Брокман е отговорил: „а, чудесно“.

Служители на OpenAI allegedly са изградили и набори от данни за обучение като WebText и WebText2, които са разчитали непропорционално на извлечено новинарско съдържание. Те allegedly са изтеглили и милиони статии от Common Crawl — безплатно, отворено хранилище на данни от обхождането на интернет. Констатациите също така описват умишлени усилия за премахване на уведомленията за авторски права от данните за обучение, преди те да достигнат до модела, тъй като изследователите „не биха искали моделът да извежда“ „уведомления за авторски права“ към потребителите.

OpenAI и Microsoft не отговориха на молбите за коментар.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от TechCrunch на

Прочетете оригинала в TechCrunch ↗

Текстът и изображенията са собственост на TechCrunch и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини