Opus 5.5 любит говорить вам: «это важно» (и другие признаки текста, написанного ИИ)
Теперь, когда проза, созданная большими языковыми моделями, повсюду, люди стремятся найти способы её распознавать. Хотя ранние признаки вроде длинных тире и слова «погружаться» уже исчезли, исследователи говорят, что у ИИ-моделей по-прежнему есть немало характерных привычек, к которым они прибегают при написании прозы.
Новое исследование маркетинговой компании Graphite было посвящено особенностям письма передовых моделей — исследователи выясняли, какие слова и фразы предпочитает каждая из них. Хотя прежние признаки, такие как использование длинных тире, были устранены, модели по-прежнему склонны использовать конструкции с многочисленными противопоставлениями, причём у каждой версии есть свои уникальные причуды. Самым большим сюрпризом оказался масштаб таких признаков. Graphite обнаружила 13 000 фраз, которые встречались в материалах, созданных ИИ, как минимум вдвое чаще, чем в текстах людей, — именно это компания считает «признаком».
«Оказывается, со временем модели Claude действительно приближаются к человеческому распределению слов, — рассказал TechCrunch директор Graphite по вопросам ИИ Грег Драк. — А у моделей GPT оно, напротив, всё сильнее от него отдаляется».
Масштабное изучение текстов, созданных ИИ, потребовало тщательно продуманного дизайна исследования. Graphite начала с корпуса из 10 000 статей, опубликованных до выхода ChatGPT, использовав их как контрольную группу материалов, написанных людьми. Затем исследователи попросили разные ИИ-модели переписать эти статьи по кратким изложениям, стремясь по возможности устранить влияние исходных текстов. Имея сопоставимые выборки материалов, созданных людьми и каждой из моделей, они смогли сравнить, как часто определённые слова и фразы появлялись в текстах ИИ, а также изучить более общие закономерности построения предложений.
Согласно результатам Graphite, главным признаком Claude Opus 5.5 является слово «надёжный», которое встречается в 23 раза чаще, чем в человеческих текстах. Хотя Opus 5.5 теперь избегает конструкции «это не X, это Y», модель по-прежнему склонна говорить, что нечто «больше, чем X, — это Y».
Прежде всего Opus любит объяснять, почему те или иные вещи важны: фраза «это важно» встречается в 116 раз чаще, чем в текстах людей, а выражение «почему X важно» — в 92 раза чаще.
У Astra от OpenAI другой набор характерных признаков. Эта модель любит описывать «ещё одно измерение» чего бы то ни было, о чём идёт речь, и склонна смягчать утверждения, говоря, что действие «может обеспечить» или «способно обеспечить» определённую пользу. Её главный признак — то, что Graphite называет «корректирующим обрамлением»: тема определяется как «не просто X» или предлагается в качестве альтернативы — «вместо того чтобы полагаться на X». Согласно исследованию Graphite, такие конструкции встречались в прозе, созданной Astra, более чем в 100 раз чаще, чем в текстах людей.
Примечательно, что, судя по всему, все разработчики передовых моделей отреагировали на идею о чрезмерном использовании длинных тире. В выборках Graphite Opus 5.5 использовала этот знак препинания на 99% реже, чем Opus 5. Astra теперь использует его на 88% реже, чем авторы-люди, тогда как Gemini 3.1 Pro практически полностью исключила длинное тире из своих текстов.
Но хотя отдельные признаки меняются, Graphite утверждает, что их общее количество в основном остаётся стабильным. «Нельзя сказать, что число признаков уменьшается, — рассказал Драк TechCrunch. — Моделям удаётся устранить наиболее известные признаки, но появляются другие. И у каждой версии модели есть свои».
Удивительно, что эти признаки сохраняются столь устойчиво, учитывая, какое внимание разработчики уделяют стилю, похожему на человеческий. В анонсе Opus 5.5 Anthropic хвасталась, что модель «общается более естественно, чем предыдущие модели», заявляя, что первые пользователи «сочли её тексты более ясными и удобными для восприятия».
OpenAI делала аналогичные заявления при выпуске версий GPT-6 под названием Sol и Luna, утверждая, что пользователи могут «ожидать большей ясности, меньшего количества жаргона [и] меньшего числа странных оборотов речи».
Однако Драк скептически относится к тому, насколько разработчики способны полностью устранить характерные конструкции или фразы.
«Моя общая гипотеза заключается в том, что разработчики способны контролировать некоторые из этих особенностей в меньшей степени, чем можно было бы ожидать, — говорит Драк. — Это гигантские модели с миллиардами параметров. Они могут провести лишь конечное число проверок, и что-то неизбежно просачивается».
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.