Sakhanda Wire
NVDA $225.01 -0.07% MSFT $480.35 -3.04% GOOGL $344.00 -0.55% META $568.97 -3.54% AMZN $261.31 -0.51%
← К новостям

Мы по-прежнему не знаем, как люди на самом деле используют ИИ

Компании, занимающиеся ИИ, такие как Anthropic и OpenAI, регулярно публикуют отчёты о том, как люди используют такие продукты, как Claude и ChatGPT, но они обнародуют только те данные, которые хотят нам показать, говорят исследователи в области ИИ. 

«Не существует независимого источника, который мог бы это подтвердить», — говорит Анка Ройель, аспирантка факультета компьютерных наук в Лаборатории надёжного ИИ Стэнфордского университета (STAIR). 

Ройель — один из руководителей нового исследовательского проекта под названием AI Observatory, призванного восполнить этот пробел. Это общедоступная платформа, которая собирала и анализировала реальные диалоги с популярными моделями, такими как Claude и Gemini, полученные с согласия пользователей из семи существующих наборов данных. Цель Observatory — предоставить независимые источники информации исследователям и политикам, чтобы они могли оценивать, как люди используют генеративный ИИ. Сейчас заинтересованные стороны принимают крайне важные решения о преимуществах и рисках ИИ, основываясь на весьма ограниченных данных, говорит Ройель. 

AI Observatory выяснила, что использование ИИ значительно различается в зависимости от модели и менялось с течением времени. Исследование показывает гораздо больше чувствительных форм использования, чем отражено в отчётах ведущих компаний в области ИИ, которые, по их словам, больше сосредоточены на работе, чем на личном использовании. 

Anthropic Economic Index — один из наиболее известных и часто цитируемых источников данных об использовании ИИ, однако у него есть слепые зоны. Как следует из названия, он посвящён связанным с работой и продуктивностью способам использования Claude AI, отфильтровывая диалоги, не относящиеся к этим целям. 

Когда команда AI Observatory применила методы Anthropic к своему набору данных, выяснилось, что почти половина диалогов — 48% — была бы отфильтрована. В этих исключённых диалогах, не связанных с работой, чаще встречались темы здоровья и отношений (44,2% против 31,2% в анализе Anthropic), темы для взрослых или незаконные темы (7,9% против 2,1%), травля и язык вражды (27,5% против 5,66%), а также сексуальный контент (16,7% против 2,4%). (Аналогично, в отчёте OpenAI за 2025 год об использовании ChatGPT выяснилось, что с работой было связано лишь 30% пользовательского использования.)

Anthropic публиковала отдельные записи в блоге о том, как люди используют Claude для поддержки или общения, и даже для создания материалов сексуального насилия над детьми, «но представленный [AI Observatory] обзорный анализ, а не разбиение по отдельным отчётам, помогает» исследователям более последовательно понимать различные способы использования, говорит Дэвид Уиддер, доцент Школы информации Техасского университета в Остине, изучающий взаимодействие людей с системами ИИ и не участвующий в работе AI Observatory. 

Рассмотренные AI Observatory наборы данных включают диалоги, состоявшиеся в период с 2023 по 2025 год, и выявили различия как в том, как люди использовали ИИ, так и в том, как отвечали различные ИИ-платформы. 

Диалоги в WildChat, одном из крупнейших и наиболее подробных наборов данных, включённых в исследование AI Observatory, со временем становились длиннее и содержательнее, о чём свидетельствует рост числа токенов в запросах, токенов в ответах и количества ходов в диалоге. 

Со временем также стало значительно больше светской беседы. Это указывает на рост использования ИИ для общения; тем временем самораскрытие со стороны ИИ-ассистентов (то есть упоминание о том, что они являются чат-ботами) сократилось. 

Кроме того, количество обменов сообщениями, которые исследователи классифицировали как чувствительное использование, то есть содержащих потенциально вредный или ограниченный контент, включая сексуальные домогательства и язык вражды, снизилось. Возможно, это свидетельствует о том, что платформы в целом внедряли более эффективные меры защиты. 

AI Observatory также выяснила, что использование ИИ существенно различалось в зависимости от модели. В зависимости от инструмента пользователи отличались по темам, стилям взаимодействия, структуре диалогов, а также по вероятности и типу чувствительных вариантов использования. 

Например, исследователи обнаружили, что люди чаще использовали Grok и Gemini для поиска информации. Grok, в частности, был особенно популярен для получения информации о новостях и политике, но именно там также концентрировалась дезинформация. (Это согласуется с другими исследованиями, которые также показали, насколько легко дезинформация распространяется в Grok. xAI не ответила на запрос о комментарии.) 

Тем временем люди чаще обращались к Anthropic за помощью в программировании, к Gemini — для общения и ролевых игр, а к ChatGPT — за помощью с домашними заданиями. 

Различия были даже между разными версиями одной и той же модели. Исследователи обнаружили, что с ChatGPT, работавшим на базе GPT-3.5, люди вели более короткие диалоги, а с GPT-4o — более длинные и итеративные, что вполне объяснимо, учитывая, что эта версия стала известна тем, что приводила к эмоциональной зависимости. 

Однако отчёты компаний, как правило, не отражали эти нюансы ни между их моделями, ни даже внутри отдельных моделей. «Ни один отчёт компании не рассказывает всей истории», — говорит Шейн Лонгпре, недавно получивший степень PhD в Media Lab Массачусетского технологического института и руководивший исследованием вместе с Ройель. 

Для создания AI Observatory Ройель и исследователи из Массачусетского технологического института, Стэнфорда, Data Provenance Initiative и других учреждений объединили 24 521 диалог, состоящий из 85 633 обменов репликами (то есть пользовательского запроса и соответствующего ответа ИИ), из семи реальных наборов данных, собранных в ходе предыдущих исследований. В этих диалогах участвовали 5 000 пользователей, взаимодействовавших с 52 различными моделями, включая ChatGPT, Gemini, Claude и Grok, в период с 2023 по 2025 год. 

Однако по сравнению с данными, к которым имеют доступ сами крупные лаборатории, эти диалоги — лишь капля в море. Например, последний Anthropic Economic AI Index основан на анализе 1 миллиона диалогов с Claude; в отчёте OpenAI о том, как люди используют ChatGPT, проанализировано 1,5 миллиона диалогов.  

Представитель Anthropic заявил, что опубликованные компанией исследования отражают конкретные вопросы и интересы её исследовательских команд, а также важность поддержки независимых внешних исследований. OpenAI не ответила на запросы о комментарии. 

Кроме того, тот факт, что набор данных AI Observatory сформирован из источников, предоставленных добровольно, означает, что в нём, вероятно, недостаточно представлены чувствительные способы использования, которыми люди могут быть менее склонны делиться. Поэтому исследователи предупреждают, что полученные результаты не отражают всё использование ИИ. 

Тем не менее работа Observatory расширяет доступ исследовательского сообщества к данным. Компании в сфере ИИ обычно не предоставляют свои данные чатов для анализа, из-за чего их отчёты, как отмечают независимые исследователи, такие как Ройель и Уиддер, как правило, сосредоточены на результатах, выставляющих их компании в наиболее выгодном свете. 

«Когда мы хотим спросить, например: используется ли универсальная система ИИ Anthropic… в основном во благо или в основном во вред… у нас нет способа ответить на этот вопрос, потому что эта информация является коммерческой тайной», — объясняет Уиддер, доцент Школы информации Техасского университета в Остине.

Данные AI Observatory будут доступны исследователям для анализа, и команда надеется со временем расширять свои наборы данных. В идеале, говорит Ройель, компании в сфере ИИ делились бы своими данными с независимыми исследователями — разумеется, способами, защищающими конфиденциальность пользователей. Но в нынешних условиях любой, кто принимает решения на основе данных об использовании ИИ, рискует «полностью действовать вслепую и принимать действительно важные решения, не зная, что на самом деле происходит за пределами нарративов этих компаний», говорит Ройель.  

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MIT Tech Review

Читать оригинал на MIT Tech Review ↗

Текст и изображения принадлежат MIT Tech Review и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости