Sakhanda Wire
NVDA $209.68 -2.35% MSFT $489.01 +1.19% GOOGL $351.00 +1.79% META $557.86 +1.45% AMZN $262.99 +1.68%
← К новостям

OpenAI создаёт ИИ-агентов для всего. Будут ли ими пользоваться все?

Насколько сильно вы готовы позволить LLM контролировать вашу цифровую жизнь? 

Чтобы получить от модели максимум пользы, нужно дать ей ключи. Для человека, привыкшего всё контролировать, или сомневающегося в ИИ это кажется слишком большой уступкой. Для Эндрю Амбросино, ведущего инженера десктопного приложения OpenAI, это единственный способ испытать будущее, поэтому теперь приложение имеет доступ к его почтовому ящику, аккаунту в Slack, телефону, таким приложениям, как Notion и Figma, и может управлять ими.

«Если я прошу её написать документ, существует ли вероятность, что она возьмёт информацию из личного сообщения на эту тему и не поймёт, что некоторыми данными делиться не следует? Да», — сказал Амбросино TechCrunch. «Я делаю это ради работы. Если понадобится, я готов время от времени идти на личные жертвы. Но пока не пришлось».

Амбросино работает над крупнейшей ставкой OpenAI — ChatGPT Work, выпущенным в прошлом месяце и доступным на самом дешёвом уровне подписки компании за $20 в месяц. Продукт призван позволить офисным сотрудникам использовать ИИ-агентов, подключая LLM к цифровым рабочим процессам, которыми пользуются бухгалтеры, инвесторы, врачи и все остальные, чья повседневная работа в значительной степени проходит за компьютером. 

Маркетинговые материалы OpenAI кратко формулируют цель: мир, в котором «[искусственный] интеллект выходит за рамки ответов на вопросы и помогает каждому воплощать свои самые масштабные идеи в реальность».

Для разработчиков программного обеспечения этот сдвиг уже происходит, но до других отделов он пока добирается медленно. ChatGPT Work — это модифицированная версия инструмента компании для написания кода Codex. Он должен предоставить неинженерам те же возможности, которые инженеры-программисты уже получают от агентов: ИИ-инструмент, который не просто отвечает на вопросы, а самостоятельно выполняет многоэтапные проекты.

«В этом новом формате ChatGPT действительно может полностью автономно выполнять за вас целые, очень сложные задачи — причём восхитительным и безопасным образом», — сказал TechCrunch Тибо Соттио, руководящий ключевыми продуктовыми направлениями OpenAI, включая Work. «В этом и состоит сама миссия OpenAI — дать возможность всем двигаться вперёд».

С коммерческой точки зрения это очень важно. Агенты, работающие дольше, расходуют больше токенов, что делает их более прибыльными для OpenAI в расчёте на одного пользователя. Выход на новые профессии крайне важен — не только для OpenAI, но и для индустрии в целом. Если программирование оказалось прибыльной сферой для ИИ-лабораторий, это всё же лишь небольшая часть профессиональной деятельности, которую должны поддержать ИИ-инструменты, чтобы такие компании могли оправдать огромные вложения в обучение и вычислительные мощности. Пока лаборатории сосредоточены на инженерах-программистах, конкуренты, ориентированные на отдельные отрасли, такие как Harvey (для юристов) и Clay (для продаж), привлекают этих клиентов с помощью подхода, не привязанного к конкретной модели: они подключают ту ИИ-модель, которая в данный момент работает лучше всего.

Отраслевые аналитики считают это одной из главных проблем, стоящих перед OpenAI и её конкурентами. «Если лаборатории не смогут быстро получить доступ к ключевым дополнительным активам, необходимым для масштабирования ИИ на рынке, ценность будет создаваться где-то ещё», — написал Кристиан Каталини в блоге a16z Time to Build. 

Чтобы ИИ-приложения работали для людей, не являющихся инженерами-программистами, им требуется больше сопровождения. Сотрудники OpenAI, не связанные с инженерной деятельностью, например команды коммуникаций и финансов, начали пользоваться Codex «в тот момент, когда он был для них фактически враждебным — задавал им вопросы о коде и показывал: “О, у вас пустой diff для этой вещи”», — сказал Амбросино, имея в виду технический отчёт об изменениях в программном обеспечении. «Поэтому с февраля и до настоящего момента мы начали превращать его в инструмент общего назначения».

График, показывающий использование Codex среди подписчиков OpenAI, из отчёта «Переход к агентному ИИ: данные Codex».Авторы изображения:Джонстон и др.

Исследование, проведённое при поддержке OpenAI, показало, что в июне Codex использовали 98% сотрудников OpenAI, но лишь 17% корпоративных подписчиков и менее 1% индивидуальных подписчиков пользовались агентным инструментом для написания кода. Эта разница между почти тотальным внедрением внутри компании и ничтожным уровнем использования за её пределами — одновременно вызов и возможность для OpenAI.

«Чем больше ценности и пользы мы создаём для пользователей, тем охотнее они будут платить за какую-то часть этой пользы — именно так мы всегда воспринимали и ChatGPT», — сказал Соттио. «Вы сидите и думаете: “Конечно, я хочу платить $20 в месяц за это”, потому что получаемая ценность намного выше».

Как сделать ИИ интуитивно понятным 

Чтобы понять эту разницу, полезно разобраться, что именно создают инженеры OpenAI. Каждой LLM требуется то, что инженеры называют «обвязкой», — программное обеспечение, окружающее модель и определяющее, какую информацию она видит, какие инструменты может использовать и как представляет вам свои ответы. 

Если вы хотите, чтобы модель что-то делала — то есть стала агентом, — обвязка предоставляет ей инструменты и инструкции по их использованию для выполнения долгосрочных задач. Для разработчиков интерфейса командной строки (CLI), позволившего LLM писать код, оказалось достаточно, чтобы изменить способы создания и развёртывания программного обеспечения. Но большинство людей не используют CLI — не зря Windows пришла на смену DOS. 

Агентный продукт, выходящий за пределы разработки программного обеспечения, «будет взаимодействовать с хаотичным миром вашей жизни, вашими инструментами и сайтами, созданными в 1995 году и с тех пор не обновлявшимися», — сказал Амбросино TechCrunch, объясняя, что создаваемые его командой сценарии работы крайне важны для расширения доступа к полезному ИИ.

Возьмём такие приложения, как Claude Code и Codex: они породили «вайбкодинг», абстрагировавшись от самого написания программного обеспечения и позволив пользователям просто сообщать модели, какую программу они хотят получить. Теперь OpenAI хочет сделать функции таких инструментов, как OpenClaw, которые программисты используют для применения LLM в работе, такими же простыми, как написание запроса. 

«Без этих продуктов перед моделью эксперты знали бы, как получить те же результаты, но невозможно было бы добиться того, чтобы этим инструментом пользовался миллиард человек», — сказал Амбросино. Этот компромисс между потребностями продвинутых пользователей и требованиями массового внедрения обсуждается внутри OpenAI, где некоторые сотрудники утверждают, что кнопка не нужна, если пользователи могут просто напрямую попросить модель.

«Мы возражаем против этого, потому что сейчас ещё очень ранний этап», — сказал Амбросино. «На этой стадии важна обнаруживаемость, а когда-нибудь кнопки не будет». 

В Work есть ещё несколько кнопок для выбора проектов и плагинов, но он стремится сохранить тот же интерфейс «волшебного окна», что и другие продукты OpenAI.Он сравнивает это со скевоморфизмом — постепенно исчезающей практикой делать цифровые инструменты похожими на физические объекты, которые они заменили, например оформлять приложение-калькулятор как карманный калькулятор. «Это было не просто нелепым дизайном. Это действительно помогло вовлечь людей в [новую технологию] и совершить переход», — сказал Амбросино.

 OpenAI не сообщила, сколько людей пользуются Work по сравнению с Codex, однако объединённым приложением пользуются всего 20 миллионов человек — в сравнении с более чем миллиардом пользователей, которые, по словам компании, вводят запросы в ChatGPT онлайн. 

Лицензия для ChatGPT на освоение навыков

Пока OpenAI позиционирует этот инструмент как наиболее подходящий для рутинных задач по координации, связанных с большими объёмами данных. Например, сотрудники компании настраивают еженедельные отчёты по метрикам и превращают электронные таблицы в инструменты планирования.

Я разговаривал с венчурными инвесторами, использующими агентов для сбора релевантной переписки и аналитики о компаниях в инвестиционные меморандумы, а также с операционными командами, создающими специализированные панели мониторинга и визуализации данных. Сэм Альтман использует его, чтобы планировать отпуск. Один из инженеров OpenAI рассказал, что просил программу изучить обсуждение инженерной проблемы в Slack и «сделать несколько графиков», после чего получал ряд содержательных визуализаций.

«Обычный сотрудник любой из этих компаний, включая меня, сталкивается с настоящим потоком информации», — сказал Акшай Натан, руководящий командой продуктовой разработки OpenAI. «Наши возможности довольно сильно ограничены тем, насколько хорошо мы можем обработать всё, что нам доступно, а затем принять меры. Эта информация хранится во всех этих системных инструментах и записях [например, Salesforce… ценность ChatGPT в том, что у вас уже есть к этому доступ, но теперь вы по-настоящему получаете к этому доступ».

Итак, это может стать цифровым персональным помощником, о котором мечтают евангелисты ИИ. Как и Claude Cowork или агент Perplexity AI для работы с веб-страницами, ChatGPT Work связывает агентов с вашим существующим рабочим пространством — электронной почтой, веб-браузером, множеством SaaS-платформ — и использует этот контекст в ваших интересах.

Когда система работает, это впечатляет: я попросил ChatGPT Work извлечь из электронной почты странно отформатированный календарь занятий моего сына в дошкольном учреждении и добавить его в Google Calendar — и он это сделал, избавив меня от большого объёма повторного ввода данных. Надеюсь, теперь я не забуду о школьной вечеринке с совместным угощением и не забуду заранее организовать присмотр за ребёнком на время отпуска.

Я не доверил OpenAI доступ к своему почтовому ящику, исходным интервью или черновикам статей (не волнуйтесь, противники ИИ) и не позволил бы ей получить доступ к банковскому счёту, но думаю, что инструмент был бы полезнее, будь у меня такая вера. Я поручил ему провести финансовый анализ публичных компаний, за которыми слежу, и получил автоматически обновляемую панель с метриками; он создал базу данных о космических запусках — задачу, которую раньше мне пришлось бы решать с помощью скриптов на Python. Он также каждую неделю отправляет мне письмо о новых исследованиях в области ИИ, опубликованных в академических репозиториях. Я продолжу экспериментировать с ним.

Хотя попросить модель о чём-то интуитивно понятно, предоставить ей всё необходимое для выполнения действия не так просто. Настройка разрешений для доступа агентов, например, к облачному диску была запутанной и замкнутой по кругу — я несколько раз пытался предоставить только доступ «для чтения» и получал сообщения об ошибках. Сама модель не слишком помогала, но в конце концов в мобильном приложении появилось диалоговое окно, сообщившее, что всё заработает только при предоставлении полного доступа. 

Многие важные настройки доступны только в веб-приложении, поэтому я часто обнаруживал, что одновременно работаю в обеих версиях. Иногда ограничения ChatGPT Work озадачивают: подключив его к Google Calendar, можно создавать события, но нельзя создавать новые календари. И не пытайтесь что-либо делать, если не выставить высокий уровень усилий, иначе получите худшего стажёра из всех, с кем вам когда-либо приходилось работать.

Это распространённый совет от первых пользователей ИИ, которые опасаются, что разочаровавшиеся новички сдадутся. Джо Гершенсон, руководитель инженерного направления, отвечающего за обвязку OpenAI, признал, что настройки уровня усилий пока неинтуитивны для новых пользователей: «…мы можем лучше помогать им выбирать правильный уровень рассуждений…» — сказал он, добавив: «Следите за новостями».

Перед OpenAI стоит ещё одна важная проблема при выходе на рынок обычной офисной работы: большинство рабочих процессов не так измеримы или поддаются оценке, как код. Программное обеспечение либо работает, либо нет, и даже это различие упрощает нюансы, определяющие, что делает код хорошим или плохим. Хорошую презентацию, бизнес-стратегию или коммерческое предложение оценить или отследить не так просто. 

«Одна из уникальных проблем такого продукта заключается в том, что он действительно может делать что угодно», — сказал Амбросино. Когда я спросил, вокруг каких конкретных проблем команда проектирует продукт и на какие рабочие процессы ориентируется, опрошенные мной инженеры уклонились от ответа, заявив, что это вопрос к исследовательской команде OpenAI. 

Позднее OpenAI предоставила ответ TechCrunch, сообщив, что использует свой бенчмарк GDPVal, созданный на основе 44 профессий и сотен тестов на выполнение интеллектуальной работы, и дополняет его отзывами пользователей.Более неофициальный ответ дают сами сотрудники OpenAI. Амбросино сказал: «Мы всегда должны отделять одно от другого… выполняем ли мы рабочий процесс, которым будут пользоваться все остальные, или мы странные?» 

Первые пользователи самого приложения создадут ценные данные о реальном использовании — значительная часть успеха инструментов для написания кода основана на аналогичном сборе данных, — если только они не откажутся предоставлять их для обучения. (Я отказался).

Соперничество, определившее дизайн продукта OpenAI

Несмотря на всё внимание к интерфейсу модели, инженеры OpenAI неохотно отвечали на довольно простой вопрос: чем Codex и ChatGPT Work отличаются от Claude CoWork или других конкурирующих агентных обвязок, предназначенных для массового пользователя?

«Для вас это будет очень разочаровывающий ответ, и мне жаль, но честный ответ заключается в том, что я действительно не смотрю на создаваемые ими обвязки», — сказал Гершенсон, дав типичный ответ. «Здесь на ум приходит мем из “Безумцев”: “Я вообще о тебе не думаю”».

Честно говоря, я им не верю — хотя бы из-за поразительного сходства пользовательских интерфейсов этих продуктов, необходимости конкурентной разведки в любом бизнесе и того, что первым делом ChatGPT Work попросил меня после запуска перенести мои данные из Claude Cowork. 

Понятно, почему Claude Code — чувствительная тема в офисах OpenAI. Их корпоративный конкурент определил рынок ИИ-инструментов для программирования и запустил революцию в работе инженеров-программистов. Особенно обидно, потому что идея сначала возникла у OpenAI, но компании не удалось правильно оформить её в виде обвязки. 

Когда OpenAI впервые разработала Codex как веб-приложение, инженеры немного переоценили свои возможности или, как выразился Амбросино, стали «чуть более ориентированными на AGI». Короче говоря, они поставили на то, что модель окажется достаточно умной, чтобы полностью самостоятельно справляться с задачей при минимальном участии пользователя.

Созданный вскоре после этого Claude Code был ориентирован на диалог с пользователем в формате обмена репликами. Если вы ставили перед ним проблему, он изучал возможные варианты и предлагал три или четыре способа продолжить работу. После вашего выбора он продвигался немного дальше, а затем снова связывался с вами, постоянно сообщая об обновлениях и оставляя меньше возможностей модели и обвязке допустить ошибку.

Подход Anthropic оказался эффективнее, хотя и требовал от пользователей больше работы. «[Наш] продукт немного опередил возможности модели и обвязки на тот момент», — говорит теперь Амбросино. 

В конце концов OpenAI последовала этому примеру, добавив пользователям больше возможностей взаимодействовать с моделью. Так появился знакомый нам сегодня Codex — с десктопным и мобильным приложениями. Если судить об интересе к программам по статистике загрузок, до апреля этого года Claude Code пользовался большим спросом, но теперь Codex вышел на небольшое первое место; опросы корпоративных пользователей также указывают, что OpenAI сокращает отставание.

Часть этого преимущества связана с правильным соответствием продукта рынку, а часть — с жалобами на ограничения безопасности моделей Anthropic и нехватку вычислительных ресурсов. OpenAI продолжает двигаться в сторону более ориентированных на человека обвязок с ChatGPT Work, однако опрошенные мной инженеры настаивали, что главным отличием является мощность последних производительных и экономичных моделей OpenAI. 

«Разочаровывающий ответ заключается в том, что очень часто дело именно в модели, и одна из вещей, которые мы старались сделать особенно хорошо в этом приложении, — полностью задействовать возможности модели», — сказал Амбросино. 

Что вообще делает обвязку хорошей?

Это объяснение возвращает нас к «горькому уроку», усвоенному исследователями ИИ: более важна улучшенная универсальная модель, чем опыт в конкретной предметной области. Для истинных сторонников этой идеи обвязка — временный костыль, а не конкурентное преимущество.

«В краткосрочной перспективе можно получить хорошие результаты, добавив целую кучу дополнительных элементов — условий, инструментов и так далее, — но, ну же, следующая модель выйдет через пару месяцев и сделает всё это устаревшим», — сказал Гершенсон TechCrunch. Его команда сосредоточена на самых простых способах предоставить модели необходимые инструменты и контекст — и ничего сверх этого. 

«Цель хорошей инженерии обвязки —… точнее определить, какая информация действительно нужна модели для решения вашей проблемы, потому что модели всё лучше и лучше справляются с этим, если просто позволить им делать своё дело», — сказал Гершенсон.

Однако остаётся открытым вопрос, готовы ли к этому большинство людей или моделей. Итан Моллик, профессор бизнес-школы Уортон, изучающий ИИ-инструменты на рабочем месте, по-прежнему считает Claude более удобным для пользователей, пишет, что «ChatGPT обычно хочет сотворить магию и просто сделать всё за вас, тогда как Claude сравнивает варианты и показывает их, снова и снова запрашивая ввод и обратную связь и проводя тесты A и B».

Соттио и, возможно, OpenAI в целом с этим не согласны, утверждая, что разговорный характер приложения лучше, чем необходимость учиться пользоваться отдельным приложением. «Мы определённо видим, что мир, похоже, готов», — говорит он о приложении. «Именно поэтому оно получило невероятное распространение».

Тем не менее неясно, является ли обвязка, специфичная для конкретной модели, правильной ставкой для максимального раскрытия её возможностей. Сравнения, проведённые такими компаниями, как Composio и Databricks, показывают, что разные сочетания обвязок и моделей демонстрируют разную производительность в тестах на написание кода. Databricks выяснила, что Pi — обвязка с открытым исходным кодом, опубликованная разработчиком программного обеспечения Earendi, — превзошла Codex, используя ту же модель GPT 5.5. Pi применялась для создания таких проектов, как OpenClaw и CloudflareOS. 

Создатель Pi Марио Цехнер считает, что его намеренно минималистичная обвязка доказывает: подход, ориентированный на AGI, может работать — по крайней мере для инженеров-программистов и задач по написанию кода. По его словам, недостаток явных функций компенсируется способностью системы изменять себя и создавать собственные интерфейсы. Он понимает, с какими трудностями сталкиваются инженеры OpenAI, расширяя пользовательскую базу за пределы инженерного сообщества.

«Всё имеет форму агента для написания кода… причина в том, что у них есть обучающие данные только для задач агентов, пишущих код», — сказал он TechCrunch. «Допустим, я занимаюсь управлением и сегодня принимаю решение, а результат появляется через несколько месяцев. Это невозможно зафиксировать в простой записи взаимодействия пользователя и агента, поэтому все подобные задачи — и вообще всё, что вы не оцифровываете, — недоступно модели для обучения».

Как и другие поставщики решений с открытым исходным кодом, он видит усилия большой лаборатории по продвижению собственных обвязок как способ привязать к ним пользователей: «Им необходимо владеть всем стеком, иначе они просто станут поставщиком моделей, а затем им придётся конкурировать с китайскими моделями». 

Он и другие инженеры, с которыми поговорил TechCrunch, считают, что данные о расходе токенов и поведении агентов в обвязках передовых лабораторий слишком ограничены. В некотором смысле это менее важно для нетехнических работников, но, как и в случае с инструментами для написания кода, внедрение в масштабах, на которые надеется OpenAI, в конечном итоге вынудит вести более сложные разговоры о стоимости. 

Например, экспериментируя с подпиской за $20 в месяц, за четыре дня я использовал более 80 миллионов токенов, что, согласно анализу модели (в приложении нет соответствующей панели), обошлось в $65. Таким образом, всего за четыре дня неформального использования субсидия превысила стоимость подписки более чем втрое.

«Мы каждый день работаем над повышением эффективности», — сказал Соттио, указав на недавнее снижение цены на 80% для пользователей модели OpenAI Luna. «Через шесть месяцев вы должны будете выполнять все те же [задачи], тратя меньше средств».

Другой важный вопрос заключается в том, создают ли эти приложения эффект привязки клиентов за счёт хранения данных или самой мучительности настройки доступа ко всем плагинам и их разрешениям. 

В штаб-квартире OpenAI с деревянными панелями и множеством растений, которую я посетил в июле, атмосфера была спокойной, но слегка напряжённой; этим людям предстоит очень много работы. Инженеры, с которыми я разговаривал, постоянно следили за экранами своих ноутбуков и спешили из одной переговорной в другую. 

Натан, руководитель команды продуктовой разработки, сказал, что основное внимание по-прежнему уделяется «обещанию волшебного окна, но я всё ещё думаю, что здесь слишком много сложностей… Я настроен очень оптимистично и считаю, что мы можем решить эту проблему с помощью модели и по-настоящему нативным для ИИ способом».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости