Проучване на Pew потвърждава резкия ръст на текстовете, писани от ИИ, в мрежата след старта на ChatGPT
Основни акценти
- При анализ на близо половин милион уебстраници на английски език Pew Research Center установи, че повече от една трета от страниците, публикувани след пускането на ChatGPT, показват признаци на текст, генериран от AI.
- Текстовете от уебархива Common Crawl бяха анализирани с помощта на инструмента за откриване Open Pangram. В търговските домейни .com има приблизително десет пъти по-често текст, генериран от AI, отколкото в сайтовете .edu или .gov.
- Анализът обаче има ограничения, главно защото съвременните инструменти за откриване едва могат да различат напълно автоматизирания текст от текст, при чието създаване AI е бил използван само частично.
Pew Research Center анализира близо половин милион уебстраници на английски език за съдържание, генерирано от AI. От пускането на ChatGPT насам делът на написаните от машини текстове онлайн рязко се е увеличил.
Текстовете са взети от уебархива Common Crawl и са проверени за признаци на машинно авторство с помощта на инструмента за откриване на AI Open Pangram. В извадка от юли 2026 г. около 10 процента от всички изследвани страници показват ясни признаци на авторство от AI.
Филтрирането на извадката така, че да включва само страници, публикувани след пускането на ChatGPT, променя картината драстично. Повече от една трета от тези по-нови страници показват признаци на авторство от AI, според анализа. Тенденцията започва с ChatGPT в края на 2022 г., а делът на вероятно генерираното от AI уебсъдържание оттогава насам постоянно нараства.

Около една от всеки десет страници с домейн .com показва признаци на авторство от AI, докато при домейните .org делът е 4,6 процента, а при домейните .edu и .gov е само около 1 процент. Това означава, че в търговските уебсайтове вероятността да има текст, написан от AI, е приблизително десет пъти по-голяма, отколкото при страниците на училища или правителствени агенции.

„Delve“, дългите тирета и оксфордските запетаи набират популярност
Анализът на Pew установява няколко езикови модела, които са станали много по-често срещани в мрежата след 2023 г. Дългите тирета вече се срещат около два пъти по-често, отколкото през 2023 г., а употребата на оксфордски запетаи е нараснала с 63 процента.

Някои предпочитани от AI думи като „delve“, „interplay“, „testament“, „pivotal“, „landscape“, „tapestry“, „bolstered“, „crucial“, „meticulous“ и „vibrant“ са се срещали повече от два пъти по-често. Отрицателните паралелни конструкции по модела „това не е просто X, а Y“ са се увеличили почти тройно, макар че в абсолютни стойности остават редки. Отделно проучване на корпоративни PR документи установи, че тази конкретна фраза се е увеличила четирикратно от 2022 г. насам.
Проучване на Imperial College London, Internet Archive и Stanford University от април 2026 г. стига до сходно заключение, като установява, че приблизително 35 процента от всички новопубликувани уебсайтове са били изцяло или частично генерирани от AI. Изследователите също така откриват с 33 процента по-висока семантична сходност между текстовете на AI и като цяло значително по-позитивен тон, но предупреждават, че общественото възприятие за негативните ефекти често надхвърля значително това, което данните действително показват.
Какво се счита за „текст на AI“ остава неясно
Тук, както и при сходни проучвания и обществения дебат, има един проблем. Никой не е съгласен какво всъщност означава „текст на AI“. Спектърът варира от напълно автоматизирано съдържание до човешки чернови, редактирани с помощта на AI, и текстове, при които моделът се е намесил само в няколко изречения.
Open Pangram и сходните модели, поне според опита ми от тестването на стотици мои собствени текстове, могат да преценят само много приблизително дали нещо вероятно е написано от човек или машина. Те не могат надеждно да кажат колко AI е бил използван или на кой етап, а и редовно дават грешни резултати. Въпреки това тези начини на работа са много различни.
Общественият дебат около текстовете на AI става все по-поляризиран, както ясно показа неотдавнашната дискусия за планирания от Anthropic воден знак върху изхода на Claude. Използването на инструменти с AI вече носи стигма, която действа и в двете посоки — нещо, което са документирали и проучванията на работното място. Нито един от двата лагера не оставя много място за сложната реалност на това как хората действително пишат с помощта на тези инструменти. А тъй като използването на AI не се забавя, намирането на този баланс ще става все по-важно.
Новини за AI без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен информационен бюлетин за AI, нашия ексклузивен годишен доклад за водещите разработки „AI Radar“, публикуван шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.