Дослідження Pew підтверджує різке зростання текстів, написаних ШІ, в інтернеті після запуску ChatGPT
Основні моменти
- Проаналізувавши майже пів мільйона англомовних вебсторінок, дослідницький центр Pew Research Center виявив, що понад третина сторінок, опублікованих після запуску ChatGPT, має ознаки тексту, згенерованого ШІ.
- Тексти з вебархіву Common Crawl аналізували за допомогою інструмента виявлення Open Pangram. Комерційні домени .com містять тексти, згенеровані ШІ, приблизно вдесятеро частіше, ніж сайти .edu або .gov.
- Однак аналіз має обмеження, головним чином тому, що сучасні інструменти виявлення майже не здатні відрізнити повністю автоматизований текст від тексту, під час написання якого ШІ використовували лише частково.
Дослідницький центр Pew Research Center проаналізував майже пів мільйона англомовних вебсторінок на наявність контенту, згенерованого ШІ. Від моменту запуску ChatGPT частка текстів, написаних машинами, в інтернеті різко зросла.
Тексти взяли з вебархіву Common Crawl і перевірили на ознаки авторства машини за допомогою інструмента виявлення ШІ Open Pangram. У вибірці за липень 2026 року близько 10 відсотків усіх перевірених сторінок мали очевидні ознаки авторства ШІ.
Якщо обмежити вибірку сторінками, опублікованими після виходу ChatGPT, картина різко змінюється. Понад третина таких нових сторінок має ознаки авторства ШІ, згідно з аналізом. Тенденція почалася разом із ChatGPT наприкінці 2022 року, і відтоді частка вебконтенту, ймовірно створеного ШІ, стабільно зростає.

Приблизно кожна десята сторінка з доменом .com має ознаки авторства ШІ, тоді як для доменів .org цей показник становить 4,6 відсотка, а для доменів .edu і .gov — лише близько 1 відсотка в кожному випадку. Це означає, що комерційні вебсайти приблизно вдесятеро частіше містять тексти, написані ШІ, ніж сторінки навчальних закладів або державних установ.

«Delve», довгі тире та оксфордські коми набувають популярності
Аналіз Pew виявив кілька мовних закономірностей, які стали значно поширенішими в інтернеті від 2023 року. Довгі тире тепер трапляються приблизно вдвічі частіше, ніж у 2023 році, а використання оксфордських ком зросло на 63 відсотки.

Певні улюблені ШІ слова, як-от «delve», «interplay», «testament», «pivotal», «landscape», «tapestry», «bolstered», «crucial», «meticulous» і «vibrant», стали траплятися більш ніж удвічі частіше. Негативні паралельні конструкції за схемою «це не просто X, це Y» трапляються майже втричі частіше, хоча в абсолютних числах вони все ще рідкісні. Окреме дослідження корпоративних PR-документів виявило, що ця конкретна фраза з 2022 року стала вчетверо поширенішою.
Дослідження Імперського коледжу Лондона, Internet Archive та Стенфордського університету, проведене у квітні 2026 року, дійшло подібного висновку: приблизно 35 відсотків усіх нових опублікованих вебсайтів були повністю або частково згенеровані ШІ. Дослідники також виявили на 33 відсотки вищу семантичну схожість між текстами ШІ та загалом значно позитивніший тон, але застерегли, що суспільне сприйняття негативних наслідків часто значно виходить за межі того, що насправді підтверджують дані.
Що вважати «текстом ШІ», досі незрозуміло
Це та подібні дослідження, як і суспільна дискусія, мають одну проблему. Ніхто не погоджується, що саме означає «текст ШІ». Спектр простягається від повністю автоматизованого контенту до людських чернеток, відредагованих за допомогою ШІ, і текстів, у яких модель долучилася лише до написання кількох речень.
Open Pangram та подібні моделі, за моїм досвідом тестування сотень власних текстів, можуть лише дуже приблизно визначити, чи ймовірно щось написала людина або машина. Вони не можуть надійно сказати, наскільки активно використовували ШІ або на якому етапі, і досі регулярно помиляються. Водночас це дуже різні способи роботи.
Суспільна дискусія навколо текстів ШІ стає дедалі поляризованішою, що чітко продемонструвала недавня дискусія щодо запланованого Anthropic водяного знака для результатів роботи Claude. Використання інструментів ШІ вже має стигму, яка працює в обох напрямках, що також підтверджують дослідження на робочих місцях. Жодна зі сторін не залишає достатньо місця для складної реальності того, як люди насправді пишуть за допомогою цих інструментів. А оскільки впровадження ШІ не сповільнюється, пошук цієї золотої середини ставатиме дедалі важливішим.
Новини про ШІ без ажіотажу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.