Opus 5.5 любить казати вам: «це важливо» (та інші ознаки текстів, написаних ШІ)
Тепер, коли проза, згенерована великими мовними моделями, всюди, люди прагнуть знайти способи її виявляти. Хоча ранні ознаки на кшталт довгих тире та слова «заглибитися» вже давно зникли, дослідники кажуть, що під час написання прози моделі ШІ все ще вдаються до безлічі характерних прийомів.
Нове дослідження маркетингової фірми Graphite проаналізувало письменницькі звички передових моделей, визначивши улюблені слова й фрази кожної з них. Хоча старі ознаки, як-от використання довгих тире, було усунуто, моделі все ще вдаються до конструкцій із великою кількістю протиставлень, причому кожна версія моделі демонструє власні унікальні особливості. Найбільше дивує те, наскільки широким виявився спектр таких ознак. Graphite виявила 13 000 фраз, які траплялися в контенті ШІ щонайменше вдвічі частіше, ніж у людському контенті, — саме це компанія називає «ознакою».
«Виявляється, моделі Claude з часом фактично наближаються до людського розподілу слів, — розповів TechCrunch директор із питань ШІ в Graphite Грег Драк. — А моделі GPT, навпаки, віддаляються від нього».
Масштабне дослідження текстів, створених ШІ, вимагало ретельно продуманого дизайну. Graphite почала з корпусу з 10 000 статей, опублікованих до виходу ChatGPT, який слугував контрольною групою текстів, написаних людьми. Потім дослідники попросили різні моделі ШІ переписати статті на основі резюме, прагнучи максимально усунути вплив джерела. Маючи зіставні вибірки текстів, написаних людьми та кожною моделлю, вони могли порівняти, як часто певні слова й фрази з’являлися в текстах ШІ, а також ширші закономірності побудови речень.
Згідно з результатами Graphite, найбільшою ознакою Claude Opus 5.5 є слово «надійний», яке трапляється у 23 рази частіше, ніж у людських зразках. Хоча Opus 5.5 тепер уникає конструкції речення «це не X, це Y», модель усе ще схильна казати, що щось «є більше, ніж X, це Y».
Найбільше Opus полюбляє пояснювати, чому щось важливе: фраза «це важливо» трапляється у 116 разів частіше, ніж у текстах людей, а конструкція «чому X важливе» — у 92 рази частіше.
У Astra від OpenAI інший набір характерних ознак. Ця модель полюбляє описувати «ще один вимір» того, про що говорить, а також схильна пом’якшувати твердження, зазначаючи, що певна дія «може забезпечити» або «здатна забезпечити» конкретну перевагу. Її найбільшою ознакою Graphite називає «коригувальне формулювання», коли тему визначають як «не просто X» або пропонують як альтернативу — «замість того, щоб покладатися на X». Згідно з дослідженням Graphite, такі конструкції траплялися в прозі, згенерованій Astra, більш ніж у 100 разів частіше, ніж у текстах людей.
Примітно, що, схоже, усі розробники передових моделей відреагували на ідею про надмірне використання моделями довгих тире. У зразках Graphite Opus 5.5 використовувала цей розділовий знак на 99% рідше, ніж Opus 5. Astra тепер використовує його на 88% рідше, ніж у людських зразках, тоді як Gemini 3.1 Pro майже повністю усунула довге тире зі своїх текстів.
Але хоча окремі ознаки змінюються, Graphite стверджує, що їхня загальна кількість здебільшого залишається стабільною. «Не можна сказати, що ознак стає менше, — розповів Драк TechCrunch. — Розробникам вдається прибирати найвідоміші ознаки, але з’являються інші. І кожна версія моделі має власні».
Дивно, що ці ознаки настільки стійкі, зважаючи на увагу, яку розробники приділяють стилям письма, схожим на людські. У релізі Opus 5.5 Anthropic хвалилася, що модель «спілкується природніше, ніж попередні моделі», зазначаючи, що перші користувачі «вважали її тексти зрозумілішими та легшими для сприйняття».
OpenAI заявила про подібні переваги, випускаючи версії GPT-6 — Sol і Luna, зазначивши, що користувачі можуть «очікувати більшої ясності, меншої кількості жаргону [та] меншої кількості дивних зворотів».
Але Драк скептично оцінює те, наскільки розробники моделей здатні повністю усунути характерні конструкції чи фрази.
«Моя загальна гіпотеза полягає в тому, що розробники моделей мають менше можливостей контролювати деякі з цих речей, ніж можна було б очікувати, — каже Драк. — Це гігантські моделі з мільярдами параметрів. Вони можуть провести лише обмежену кількість тестів, і деякі речі прослизають».
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.