Ми досі не знаємо, як люди насправді використовують ШІ
Компанії, що розробляють ШІ, як-от Anthropic і OpenAI, регулярно публікують звіти про те, як люди використовують такі продукти, як Claude і ChatGPT, але вони оприлюднюють лише ті дані, які хочуть нам показати, кажуть дослідники ШІ.
«Немає незалежного джерела, яке могло б це підтвердити», — каже Анка Реуель, аспірантка зі спеціальності «Комп’ютерні науки» лабораторії Stanford Trustworthy AI Research (STAIR).
Реуель є співкерівницею нового дослідницького проєкту під назвою AI Observatory, який має на меті заповнити цю прогалину. Це публічна платформа, що агрегувала й проаналізувала реальні розмови з популярними моделями, як-от Claude і Gemini, зібрані за згодою користувачів у межах семи наявних наборів даних. Мета Observatory — надати незалежні джерела інформації для дослідників і політиків, щоб оцінити, як люди використовують генеративний ШІ. За словами Реуель, зацікавлені сторони наразі ухвалюють надзвичайно важливі рішення щодо переваг і ризиків ШІ на основі дуже обмежених даних.
AI Observatory виявила, що використання ШІ суттєво відрізняється залежно від моделі й змінювалося з часом. Її дослідження демонструє набагато більше чутливих видів поведінки, ніж зафіксовано у звітах провідних компаній, що працюють над ШІ, які, за їхніми словами, більше зосереджені на роботі, ніж на особистому використанні.
Anthropic Economic Index — одне з найвідоміших і найчастіше цитованих джерел даних про використання ШІ, але воно має сліпі зони. Як випливає з назви, індекс зосереджується на робочих завданнях і використанні Claude AI для підвищення продуктивності, відфільтровуючи розмови, не пов’язані з цими цілями.
Коли команда AI Observatory застосувала методи Anthropic до свого набору даних, вона виявила, що майже половина розмов — 48% — була б відфільтрована. У відфільтрованих розмовах, не пов’язаних із роботою, частіше йшлося про здоров’я та стосунки (44,2% проти 31,2% в аналізі Anthropic), дорослі або незаконні теми (7,9% проти 2,1%), переслідування та ненависть (27,5% проти 5,66%), а також сексуальний контент (16,7% проти 2,4%). (У звіті OpenAI за 2025 рік про використання ChatGPT так само виявлено, що лише 30% споживчого використання було пов’язано з роботою.)
Anthropic опублікувала окремі дописи в блозі про те, як люди використовують Claude для підтримки або спілкування, і навіть для створення матеріалів сексуального насильства над дітьми, «але оглядовий аналіз [AI Observatory], а не розподіл інформації за окремими звітами, допомагає» дослідникам більш послідовно розуміти різні способи використання, каже Девід Віддер, доцент Школи інформації UT-Austin, який досліджує взаємодію людей із системами ШІ та не бере участі в роботі AI Observatory.
Набори даних, які дослідила AI Observatory, містять розмови, що відбувалися з 2023 до 2025 року, і вона виявила відмінності як у способах використання ШІ людьми, так і в реакціях різних платформ ШІ.
Розмови в WildChat, одному з найбільших і найдетальніших наборів даних, включених до дослідження AI Observatory, з часом ставали довшими й складнішими, про що свідчить збільшення кількості токенів у запитах, токенів у відповідях і ходів розмови.
З часом також стало значно більше невимушених розмов. Це свідчить про те, що спілкування з ШІ як із компаньйоном ставало дедалі поширенішим; водночас саморозкриття AI-асистентів (тобто повідомлення про те, що вони є чатботами) зменшилося.
Крім того, кількість обмінів, які дослідники позначили як чутливе використання, тобто таких, що містили потенційно шкідливий або заборонений контент, зокрема сексуальні домагання та мову ненависті, зменшилася. Це може свідчити про те, що платформи загалом запроваджували ефективніші запобіжні механізми.
AI Observatory також виявила, що використання ШІ суттєво відрізнялося залежно від моделі. Залежно від інструменту користувачі відрізнялися за темами, стилями взаємодії, структурою розмов, а також імовірністю та типом чутливих сценаріїв використання.
Наприклад, дослідники виявили, що люди частіше використовували Grok і Gemini для пошуку інформації. Grok, зокрема, був особливо популярним для отримання інформації про новини та політику, але саме там, як правило, концентрувалася дезінформація. (Це узгоджується з іншими дослідженнями, які також продемонстрували, наскільки легко дезінформація поширюється в Grok. xAI не відповіла на запит про коментар.)
Водночас люди частіше зверталися до Anthropic для програмування, до Gemini — для соціальних сценаріїв і рольових ігор, а до ChatGPT — по допомогу з домашніми завданнями.
Відмінності були навіть між різними версіями тієї самої моделі. Дослідники виявили, що люди вели коротші розмови з ChatGPT, коли він працював на GPT-3.5, і довші, більш ітеративні — з GPT-4o, що має сенс, зважаючи на те, що ця версія стала відомою тим, що призводила до емоційної залежності.
Однак у звітах компаній ці нюанси між різними моделями або навіть у межах їхніх власних моделей, як правило, не відображалися. «Жоден звіт окремої компанії не розповідає всієї історії», — каже Шейн Лонгпре, нещодавній випускник докторантури MIT Media Lab, який разом із Реуель був співкерівником дослідження.
Щоб створити AI Observatory, Реуель і дослідники з MIT, Стенфордського університету, Data Provenance Initiative та інших установ агрегували 24 521 розмову, що охоплювала 85 633 ходи (тобто запит користувача та відповідь ШІ на нього), із семи реальних наборів даних, зібраних у межах попередніх досліджень. У цих розмовах брали участь 5 000 користувачів, які взаємодіяли з 52 різними моделями, зокрема ChatGPT, Gemini, Claude і Grok, у період із 2023 до 2025 року.
Але ці розмови — лише крапля в морі порівняно з даними, до яких мають доступ самі великі лабораторії. Наприклад, останній Anthropic Economic AI Index ґрунтується на аналізі 1 мільйона розмов із Claude; у звіті OpenAI про те, як люди використовують ChatGPT, проаналізовано 1,5 мільйона розмов.
Представник Anthropic заявив, що опубліковані компанією дослідження відображають конкретні запитання та інтереси її дослідницьких команд, а також важливість підтримки зовнішніх незалежних досліджень. OpenAI не відповіла на запити про коментар.
Крім того, той факт, що набір даних AI Observatory складається з добровільно наданих джерел, означає, що в ньому, ймовірно, недостатньо представлені чутливі способи використання, якими люди можуть бути менш схильні ділитися. Тому дослідники застерігають, що його висновки не відображають усіх способів використання ШІ.
Втім, робота Observatory розширює доступ дослідницької спільноти до даних. Компанії, що працюють над ШІ, зазвичай не надають свої дані чатів для аналізу, а це означає, що їхні звіти, як правило, зосереджуються на висновках, які найкраще висвітлюють діяльність цих компаній, кажуть незалежні дослідники, зокрема Реуель і Віддер.
«Коли ми хочемо запитати, наприклад: чи використовується універсальна система ШІ Anthropic… переважно на благо чи переважно на шкоду… у нас немає способу відповісти на це запитання, оскільки ця інформація є власністю компанії», — пояснює Віддер, доцент Школи інформації UT-Austin.
Дані AI Observatory будуть доступні дослідникам для аналізу, і команда сподівається з часом розширювати свої набори даних. В ідеалі, каже Реуель, компанії, що працюють над ШІ, ділилися б своїми даними з незалежними дослідниками — звісно, у спосіб, що захищає конфіденційність користувачів. Але наразі будь-хто, хто ухвалює рішення на основі даних про використання ШІ, ризикує «повністю діяти навмання й ухвалювати надзвичайно важливі рішення, не знаючи, що насправді відбувається за межами наративів цих компаній», — каже Реуель.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.