Я создал своего интерактивного цифрового аватара — и вы можете с ним разговаривать
Когда Александру Войка, руководитель отдела по корпоративным вопросам стартапа по генерации видео Synthesia, этим летом прислал мне ссылку на новейшее пополнение их PR-команды, я удивилась. Это был интерактивный виртуальный аватар самого Александру, обученный отвечать на распространённые вопросы прессы о Synthesia — например, чем занимается компания и как работает её технология. Днём ранее я участвовала в дискуссии, где специалисты по PR спрашивали меня, не возражаю ли я против презентаций, в которых используется текст, сгенерированный ИИ. Но аватар Александру был чем-то большим — мне показалось, что это финальный босс использования ИИ в PR.
В сентябре Synthesia пригласила меня в своё новое офисное пространство в Нью-Йорке. Изначально основанная в Великобритании, Synthesia — популярный стартап в сфере цифровых аватаров, наряду с такими компаниями, как D-ID, HeyGen и Colossyan. В начале этого года компания достигла оценки в $4 млрд, а в прошлом году сообщила, что её годовой регулярный доход превысил $100 млн.
Synthesia позволяет компаниям создавать интерактивные обучающие видео с ИИ-аватарами, а недавно запустила продукт под названием Roleplay Sessions, который позволяет сотрудникам, например, практиковаться в презентации продаж с интерактивным ИИ-аватаром, отвечающим на их реплики и оценивающим их ответы.
Когда я пришла на открытие нового офиса и меня спросили, хотела бы я собственного ИИ-аватара, я даже не колебалась и ответила «да». Конечно, я хотела собственного цифрового двойника. В тот день на мне был симпатичный наряд, а причёска выглядела отлично.
До встречи со своим цифровым двойником я относилась к аватарам безразлично, но считала, что они неизбежно станут частью повседневной онлайн-жизни. Я слышала о людях, которые создают в Instagram аватары, похожие на них, чтобы те помогали им создавать контент для соцсетей. Мне всё это кажется очень интересным, и, возможно, поэтому я теперь без колебаний представляю вам своего цифрового двойника. Это первый случай, когда Synethsia создала цифрового аватара для журналиста (или вообще для кого-либо за пределами Войки). Он обучен на моей статье о том, почему стартапы, получившие венчурное финансирование, чаще совершают мошенничество, чем стартапы без венчурного финансирования, и будет отвечать только на вопросы об этой статье.
Чтобы начать, просто нажмите «начать в новом окне» ниже.
Можно задать ему такие вопросы:
- Почему я решила написать эту статью?
- О чём говорится в научной работе?
- К каким выводам пришли исследователи?
Для этого я вошла в небольшую киностудию внутри офиса Synthesia, где меня сфотографировали множество раз и записали двухминутный образец моего голоса. Я должна была дать согласие на создание этих аватаров — и вот, цифровая Дом родилась. Для меня создали персонального аватара (он просто зачитывает любой сценарий, который я ему задаю) — в очках и без очков, — а также двух интерактивных аватаров (они могут слушать меня и отвечать), тоже в очках и без очков.
Мы выбрали статью, на которой должен был обучаться интерактивный аватар, после чего одна из команд создала моего интерактивного аватара, работающего на основе комбинации моделей преобразования речи в текст, видео, языка и текста в речь. В технологический стек моего аватара входят собственные видео- и голосовые модели Synthesia, хотя компания также позволяет клиентам выбирать альтернативы от других разработчиков, таких как Cartesia, ElevenLabs, Google или OpenAI. Компании также могут выбрать любой облачный сервис для размещения своих аватаров или платить Synthesia за их размещение.
Модель преобразования речи в текст превращает сказанное людьми в текст, агентная языковая модель анализирует текст и может выполнять действия на его основе, модель преобразования текста в речь превращает ответ в аудио, а затем видеомодель (созданная Synthesia) анимирует аватара во время его речи.
В целом Synthesia создаёт три типа продуктов — платформу для создания и распространения видео с классическими аватарами, где человек вводит сценарий, а аватар его повторяет; агентную платформу Sessions, где люди могут взаимодействовать с аватарами в рамках опросов или ролевых игр; и API-платформу, которая позволяет использовать видео- и голосовые модели Synthesia в сочетании с другими технологическими сервисами для создания интерактивных аватаров или других типов продуктов.
Команде Synthesia потребовалось несколько дней, чтобы создать моих аватаров. Сначала я поигралась с персональными и ввела довольно общий сценарий, чтобы проверить, как звучит мой голос в исполнении ИИ. Я попросила его рассказать о том, что в Нью-Йорке наступила осень — моё любимое время года. Голос был довольно точным, и я обрадовалась, что он не перенял хрипоту, которая была у меня во время записи аудиосэмпла.
Я показала его друзьям, не связанным с технологиями, и они сочли его одновременно интересным и жутковатым.
Затем я показала им интерактивную версию, которая работает детерминированно, то есть говорит только то, на что была обучена отвечать. В данном случае речь шла о моей статье о венчурном мошенничестве. Я задавала ей вопросы вроде того, где я работала до TechCrunch и в какой части Нью-Йорка жила, но каждый раз она возвращала меня к этой статье.
Мои друзья не считали, что голос достаточно похож на мой, и решили, что сходство не такое хорошее, как у персонального аватара, но всё же оно было достаточно близким, чтобы казаться немного жутким. Моя мама назвала его «потрясающим», а от неё это очень высокая похвала. Она и мой отец постоянно пытались задавать ему вопросы «о том, что знают только они» обо мне, но модель не отвечала и каждый раз перенаправляла их к статье о венчурном мошенничестве.
«Не помню, чтобы рожала вас двоих», — пошутила она после испытания модели.
Этот опыт заставил меня задуматься о будущем журналистики. Согласились бы люди включить новости и увидеть, что их представляет аватар? Один инвестор сразу сказал мне, что нет. Конечно, сегодня многие выступают против мусора, созданного ИИ и заполонившего соцсети и другие платформы для обмена новостями. Но другие, кого я спрашивала, не были столь уверены. Смогут ли аватары дополнить работу журналистов — или даже заменить их? Захотят ли генеральные директоры разговаривать с ИИ-аватаром журналиста, а не с человеком?
Мне нравится в моей карьере возможность общаться с людьми, писать статьи и исследовать новые темы. Но важнейшая составляющая журналистики — доверие. Похоже, его никогда нельзя будет передать на аутсорсинг ИИ.
Если говорить не о журналистике, я уверена, что идея клонировать себя может показаться привлекательной. Больше не нужно наверстывать рабочие дела после праздников или отпуска, ведь ваша версия всегда может быть рядом и отвечать на вопросы.
Нам ещё предстоит увидеть, как будет развиваться использование аватаров в американском корпоративном мире. Но теперь, когда у меня есть собственный, я испытываю смешанные чувства. Пережив первоначальную новизну этого опыта, я внимательно посмотрела на своего аватара после того, как он перестал говорить, и стала ждать — чего именно, я не уверена. Возможно, я жду, когда он моргнёт. Или скажет что-нибудь новое, или улыбнётся, или просто даст мне понять, что он знает.
Поскольку мои цифровые двойники детерминированы, они никогда этого не сделают. Но я понимаю, насколько легко было бы человеку впасть в лёгкую форму ИИ-психоза с аватаром, который был бы недетерминированным, то есть работал бы на основе чат-бота, свободного разглагольствовать на любые темы.
Я сказала одному инвестору, что, каким бы ни оказалось будущее цифровых двойников, я предполагаю, что моё поколение, поколение Z, скорее всего, к ним не привыкнет. Они кажутся научной фантастикой: всё, что мы когда-либо видели в кино, теперь существует в реальности. Но должна сказать, что цифровые аватары кажутся мне менее пугающими, чем гуманоиды. По крайней мере, если с аватаром что-то станет странным, я всегда могу выйти из системы.
А пока вот мой персональный аватар, который расскажет вам обо всех главных статьях на нашем сайте за эту неделю!
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.