Все още не знаем как всъщност хората използват ИИ
Компании за изкуствен интелект като Anthropic и OpenAI редовно публикуват доклади за това как хората използват продукти като Claude и ChatGPT, но според изследователи на ИИ те публикуват само данните, които искат да видим.
„Няма независим източник, който да го потвърди“, казва Анка Ройл, докторант по компютърни науки в лабораторията за надежден ИИ (STAIR) към Станфордския университет.
Ройл е съръководител на нов изследователски проект, наречен AI Observatory, който има за цел да запълни тази празнина. Това е публична платформа, която обобщава и анализира реални разговори с популярни модели като Claude и Gemini, събрани със съгласието на потребителите чрез седем съществуващи набора от данни. Целта на Observatory е да предостави независими източници на информация за изследователи и политици, за да оценят как хората използват генеративния ИИ. В момента заинтересованите страни вземат изключително важни решения относно ползите и рисковете от ИИ въз основа на много ограничени данни, казва Ройл.
AI Observatory установи, че използването на ИИ се различава значително при отделните модели и се е променило с времето. Изследването му показва много повече чувствително поведение, отколкото е отразено в докладите на големите компании за ИИ, които според авторите им се фокусират повече върху работата, отколкото върху личната употреба.
Anthropic Economic Index е един от най-известните и най-често цитирани източници на данни за използването на ИИ, но има своите слепи петна. Както подсказва името му, той се фокусира върху употребите на Claude AI, свързани с работата и производителността, като изключва разговорите, които не са свързани с тях.
Когато екипът на AI Observatory приложил методите на Anthropic към своя набор от данни, установил, че почти половината от разговорите — или 48% — биха били изключени. Изключените разговори, несвързани с работа, по-често включвали здраве и взаимоотношения (44,2% спрямо 31,2% в анализа на Anthropic), теми за възрастни или незаконни теми (7,9% спрямо 2,1%), тормоз и език на омразата (27,5% спрямо 5,66%), както и сексуално съдържание (16,7% спрямо 2,4%). (Докладът на OpenAI от 2025 г. за използването на ChatGPT по подобен начин установи, че само 30% от потребителската употреба е свързана с работа.)
Anthropic е публикувала отделни публикации в блога за това как хората използват Claude за подкрепа или компания, както и за генериране на материали за сексуално насилие над деца, „но наличието на [анализа на AI Observatory] от висока перспектива, вместо той да бъде разделен в отделен доклад, помага“ на изследователите да разбират различните употреби по-последователно, казва Дейвид Уидър, асистент-професор в Училището по информационни науки към UT-Austin, който изследва как хората взаимодействат със системите за ИИ и не участва в AI Observatory.
Наборите от данни, разгледани от AI Observatory, включват разговори, провели се между 2023 и 2025 г., и изследването установява различия както в начина, по който хората използват ИИ, така и в реакциите на различните платформи за ИИ.
Разговорите в WildChat, един от най-големите и най-подробни набори от данни, включени в изследването на AI Observatory, са ставали по-дълги и по-сложни с времето, което се вижда от увеличаването на броя токени в подкани, отговори и реплики в разговорите.
С времето се е увеличил значително и броят на непринудените разговори. Това подсказва, че компанията на ИИ е ставала все по-популярна; същевременно саморазкриването на асистентите с ИИ (тоест уточняването, че са чатботове) е намаляло.
Освен това обмените, които изследователите са определили като чувствителна употреба — тоест такива с потенциално вредно или ограничено съдържание, включително сексуален тормоз и език на омразата — са намалели. Това може да подсказва, че платформите като цяло са внедрявали по-ефективни предпазни механизми.
AI Observatory установи също, че употребата на ИИ изглежда значително различно в зависимост от модела. В зависимост от инструмента потребителите се различавали по темите, стиловете на взаимодействие, структурата на разговорите, както и по вероятността и вида на чувствителните случаи на употреба.
Например изследователите установили, че хората използват Grok и Gemini по-често за извличане на информация. Grok по-специално е особено популярен за информация за новини и политика, но именно там дезинформацията има тенденция да се концентрира. (Това съответства на други изследвания , които също показват колко лесно се разпространява дезинформацията в Grok. xAI не отговори на молбата за коментар.)
Междувременно хората по-често се обръщали към Anthropic за програмиране, към Gemini за социални взаимодействия и ролеви игри, а към ChatGPT за помощ с домашните.
Имало е дори различия между различните версии на един и същ модел. Изследователите установили, че хората са водели по-кратки разговори с ChatGPT, когато той е работел с GPT-3.5, и по-дълги и итеративни разговори с GPT-4o — което е логично, предвид че тази версия стана известна с воденето до емоционална зависимост.
Докладите на компаниите обаче обикновено не отразяват тези нюанси между собствените им модели или дори в рамките на един модел. „Нито един доклад на отделна компания не разказва цялата история“, казва Шейн Лонгпре, наскоро завършил докторантурата си в Media Lab на Масачузетския технологичен институт, който е съръководител на изследването заедно с Ройл.
За да създадат AI Observatory, Ройл и изследователи от MIT, Станфордския университет, Data Provenance Initiative и други институции обобщили 24 521 разговора в рамките на 85 633 реплики (тоест потребителската подкана и съответстващия отговор на ИИ) от седем реални набора от данни, събрани в рамките на предишни изследвания. Тези разговори са проведени от 5000 потребители, взаимодействащи с 52 различни модела, включително ChatGPT, Gemini, Claude и Grok, между 2023 и 2025 г.
Но тези разговори са капка в морето в сравнение с данните, до които самите големи лаборатории имат достъп. Последният Anthropic Economic AI Index, например, се основава на анализ на 1 милион разговора с Claude; докладът на OpenAI за това как хората използват ChatGPT анализира 1,5 милиона разговора.
Представител на Anthropic заяви, че публикуваните от компанията изследвания отразяват конкретните въпроси и интереси на нейните изследователски екипи, както и важността на подкрепата за външни независими изследвания. OpenAI не отговори на молбите за коментар.
Освен това фактът, че наборът от данни на AI Observatory се основава на доброволно предоставени източници, означава, че вероятно не представя достатъчно добре чувствителните употреби, които хората може да не са склонни да споделят. Затова изследователите предупреждават, че резултатите му не са показателни за цялото използване на ИИ.
Работата на Observatory обаче разширява достъпа на изследователската общност. Компаниите за ИИ обикновено не споделят данните от разговорите си за анализ, което означава, че техните доклади са склонни да се фокусират върху констатациите, представящи компаниите им в най-добра светлина, казват независими изследователи като Ройл и Уидър.
„Когато искаме да попитаме например: използва ли се универсалната система за ИИ на Anthropic… предимно за добро или предимно за зло… нямаме начин да отговорим на този въпрос, защото тази информация е собственост на компанията“, обяснява Уидър, асистент-професор в Училището по информационни науки към UT-Austin.
Данните на AI Observatory ще бъдат достъпни за изследователи за анализ, а екипът се надява с времето да разшири своите набори от данни. В идеалния случай, казва Ройл, компаниите за ИИ биха споделили данните си с независими изследователи — по начин, който защитава поверителността на потребителите, разбира се. Но в настоящия си вид всеки, който взема решения въз основа на данни за използването на ИИ, рискува „напълно да действа на сляпо и да взема наистина важни решения, без да знае какво всъщност се случва отвъд наративите на тези компании“, казва Ройл.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.