Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Дослідження Pew підтверджує різке зростання текстів, написаних ШІ, в інтернеті після запуску ChatGPT

Певське дослідження підтверджує різке зростання кількості текстів, написаних ШІ, в інтернеті від моменту запуску ChatGPT
Маттіас Бастіан
24 серпня 2026 року
Nano Banana Pro за запитом THE DECODER

Основні моменти

  • Проаналізувавши майже пів мільйона англомовних вебсторінок, дослідницький центр Pew Research Center виявив, що понад третина сторінок, опублікованих після запуску ChatGPT, має ознаки тексту, згенерованого ШІ.
  • Тексти з вебархіву Common Crawl аналізували за допомогою інструмента виявлення Open Pangram. Комерційні домени .com містять тексти, згенеровані ШІ, приблизно вдесятеро частіше, ніж сайти .edu або .gov.
  • Однак аналіз має обмеження, головним чином тому, що сучасні інструменти виявлення майже не здатні відрізнити повністю автоматизований текст від тексту, під час написання якого ШІ використовували лише частково.

Дослідницький центр Pew Research Center проаналізував майже пів мільйона англомовних вебсторінок на наявність контенту, згенерованого ШІ. Від моменту запуску ChatGPT частка текстів, написаних машинами, в інтернеті різко зросла.

Тексти взяли з вебархіву Common Crawl і перевірили на ознаки авторства машини за допомогою інструмента виявлення ШІ Open Pangram. У вибірці за липень 2026 року близько 10 відсотків усіх перевірених сторінок мали очевидні ознаки авторства ШІ.

Якщо обмежити вибірку сторінками, опублікованими після виходу ChatGPT, картина різко змінюється. Понад третина таких нових сторінок має ознаки авторства ШІ, згідно з аналізом. Тенденція почалася разом із ChatGPT наприкінці 2022 року, і відтоді частка вебконтенту, ймовірно створеного ШІ, стабільно зростає.

Частка сторінок із текстом, згенерованим ШІ, різко зросла після виходу ChatGPT. | Зображення: Pew Research Center

Приблизно кожна десята сторінка з доменом .com має ознаки авторства ШІ, тоді як для доменів .org цей показник становить 4,6 відсотка, а для доменів .edu і .gov — лише близько 1 відсотка в кожному випадку. Це означає, що комерційні вебсайти приблизно вдесятеро частіше містять тексти, написані ШІ, ніж сторінки навчальних закладів або державних установ.

Комерційні сайти .com значно частіше використовують тексти, згенеровані ШІ. | Зображення: Pew Research Cente

«Delve», довгі тире та оксфордські коми набувають популярності

Аналіз Pew виявив кілька мовних закономірностей, які стали значно поширенішими в інтернеті від 2023 року. Довгі тире тепер трапляються приблизно вдвічі частіше, ніж у 2023 році, а використання оксфордських ком зросло на 63 відсотки.

Типові для текстів ШІ слова, фрази та пунктуаційні закономірності стали значно поширенішими в інтернеті. | Зображення: Pew Research Center

Певні улюблені ШІ слова, як-от «delve», «interplay», «testament», «pivotal», «landscape», «tapestry», «bolstered», «crucial», «meticulous» і «vibrant», стали траплятися більш ніж удвічі частіше. Негативні паралельні конструкції за схемою «це не просто X, це Y» трапляються майже втричі частіше, хоча в абсолютних числах вони все ще рідкісні. Окреме дослідження корпоративних PR-документів виявило, що ця конкретна фраза з 2022 року стала вчетверо поширенішою.

Дослідження Імперського коледжу Лондона, Internet Archive та Стенфордського університету, проведене у квітні 2026 року, дійшло подібного висновку: приблизно 35 відсотків усіх нових опублікованих вебсайтів були повністю або частково згенеровані ШІ. Дослідники також виявили на 33 відсотки вищу семантичну схожість між текстами ШІ та загалом значно позитивніший тон, але застерегли, що суспільне сприйняття негативних наслідків часто значно виходить за межі того, що насправді підтверджують дані.

Що вважати «текстом ШІ», досі незрозуміло

Це та подібні дослідження, як і суспільна дискусія, мають одну проблему. Ніхто не погоджується, що саме означає «текст ШІ». Спектр простягається від повністю автоматизованого контенту до людських чернеток, відредагованих за допомогою ШІ, і текстів, у яких модель долучилася лише до написання кількох речень.

Open Pangram та подібні моделі, за моїм досвідом тестування сотень власних текстів, можуть лише дуже приблизно визначити, чи ймовірно щось написала людина або машина. Вони не можуть надійно сказати, наскільки активно використовували ШІ або на якому етапі, і досі регулярно помиляються. Водночас це дуже різні способи роботи.

Суспільна дискусія навколо текстів ШІ стає дедалі поляризованішою, що чітко продемонструвала недавня дискусія щодо запланованого Anthropic водяного знака для результатів роботи Claude. Використання інструментів ШІ вже має стигму, яка працює в обох напрямках, що також підтверджують дослідження на робочих місцях. Жодна зі сторін не залишає достатньо місця для складної реальності того, як люди насправді пишуть за допомогою цих інструментів. А оскільки впровадження ШІ не сповільнюється, пошук цієї золотої середини ставатиме дедалі важливішим.

Новини про ШІ без ажіотажу — відібрані людьми

Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерело: Pew Research

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини