Исследование Pew подтверждает резкий рост текстов, написанных ИИ, в интернете после запуска ChatGPT
Ключевые моменты
- Проанализировав почти полмиллиона веб-страниц на английском языке, исследовательский центр Pew Research Center обнаружил, что более трети страниц, опубликованных после запуска ChatGPT, содержат признаки текста, сгенерированного ИИ.
- Тексты из веб-архива Common Crawl анализировались с помощью инструмента обнаружения Open Pangram. На коммерческих доменах .com тексты, сгенерированные ИИ, встречаются примерно в десять раз чаще, чем на сайтах .edu или .gov.
- Однако у анализа есть ограничения, главным образом потому, что современные инструменты обнаружения едва ли способны отличить полностью автоматизированный текст от текста, лишь частично созданного с помощью ИИ.
Исследовательский центр Pew Research Center проанализировал почти полмиллиона веб-страниц на английском языке на предмет контента, созданного ИИ. После запуска ChatGPT доля машинописного текста в интернете резко выросла.
Тексты были взяты из веб-архива Common Crawl и проверены на признаки машинного авторства с помощью инструмента обнаружения ИИ Open Pangram. В выборке за июль 2026 года около 10 процентов всех исследованных страниц содержали явные признаки авторства ИИ.
Если ограничить выборку страницами, опубликованными после выхода ChatGPT, картина резко меняется. Более трети этих новых страниц содержат признаки авторства ИИ, согласно анализу. Тенденция началась с появления ChatGPT в конце 2022 года, и с тех пор доля веб-контента, вероятно созданного ИИ, стабильно растёт.

Примерно на каждой десятой странице с доменом .com обнаруживаются признаки авторства ИИ, тогда как для доменов .org этот показатель составляет 4,6 процента, а для доменов .edu и .gov — всего около 1 процента. Таким образом, на коммерческих сайтах вероятность встретить текст, написанный ИИ, примерно в десять раз выше, чем на страницах учебных заведений или государственных учреждений.

«Delve», длинные тире и оксфордские запятые набирают популярность
Анализ Pew выявил несколько языковых особенностей, которые стали гораздо чаще встречаться в интернете после 2023 года. Длинные тире теперь используются примерно вдвое чаще, чем в 2023 году, а частота использования оксфордской запятой выросла на 63 процента.

Некоторые любимые ИИ слова, такие как «delve», «interplay», «testament», «pivotal», «landscape», «tapestry», «bolstered», «crucial», «meticulous» и «vibrant», стали встречаться более чем вдвое чаще. Отрицательные параллельные конструкции по модели «это не просто X, это Y» стали встречаться почти втрое чаще, хотя в абсолютных цифрах они по-прежнему редки. Отдельное исследование корпоративных PR-документов показало, что эта конкретная фраза стала использоваться в четыре раза чаще с 2022 года.
Исследование Имперского колледжа Лондона, Internet Archive и Стэнфордского университета, опубликованное в апреле 2026 года, пришло к похожему выводу: примерно 35 процентов всех недавно опубликованных веб-сайтов были полностью или частично созданы ИИ. Исследователи также обнаружили на 33 процента более высокое семантическое сходство между текстами ИИ и в целом гораздо более позитивный тон, однако предупредили, что общественное восприятие негативных последствий зачастую значительно выходит за рамки того, что действительно подтверждают данные.
Что считать «текстом ИИ», по-прежнему неясно
У этого и подобных исследований, как и у общественной дискуссии в целом, есть проблема. Никто не может прийти к единому мнению о том, что вообще означает «текст ИИ». Спектр простирается от полностью автоматизированного контента до написанных человеком черновиков, отредактированных с помощью ИИ, и текстов, в которых модель участвовала лишь при создании нескольких предложений.
Open Pangram и аналогичные модели, судя по моему опыту тестирования сотен собственных текстов, способны лишь очень приблизительно определить, скорее всего, человек или машина написали тот или иной текст. Они не могут надёжно сказать, насколько активно использовался ИИ и на каком этапе, и по-прежнему регулярно ошибаются. Однако это совершенно разные способы работы.
Общественная дискуссия о текстах ИИ становится всё более поляризованной, что наглядно показало недавнее обсуждение запланированного Anthropic водяного знака для текстов Claude. Использование инструментов ИИ уже сопровождается стигмой, причём действующей в обе стороны, что также подтверждают исследования на рабочих местах. Ни одна из сторон не оставляет много места для сложной реальности того, как люди действительно пишут с помощью этих инструментов. А поскольку внедрение ИИ не замедляется, поиск этой золотой середины будет становиться всё более важным.
Новости об ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный аналитический отчёт «AI Radar» о передовых разработках шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.