Opus 4.6 від Anthropic — машина для порно
Універсальні стандарти використання Anthropic для Claude забороняють моделі генерувати відверто сексуальний контент, зокрема зображати або запитувати статевий акт чи сексуальні дії, генерувати контент, пов’язаний із сексуальними фетишами або фантазіями, чи брати участь в еротичних чатах. Але це не завадило Claude Opus 4.6, моделі Anthropic, випущеній на початку цього року, охоче брати участь у сценаріях еротичної рольової гри, яким мають запобігати її захисні механізми.
Під час тестування TechCrunch Opus 4.6 навіть не потребувала особливих умовлянь, щоб обійти обмеження на сексуальні матеріали. У 10 із 10 прямих запитів на створення відверто сексуального контенту модель одразу погодилася.
Інші старіші моделі, зокрема Opus 3 і Haiku 4.5, також генерують відверто сексуальний контент за допомогою нещодавно використаного методу джейлбрейку.
Незалежний дослідник із Великої Британії, який вирішив залишитися анонімним, ексклюзивно поділився з TechCrunch багатоетапною технікою, яка поступово підштовхує певні моделі Claude до генерування заборонених відверто сексуальних матеріалів. Новіші моделі Opus (від 4.7 до поточної Opus 5) стійкі до цього джейлбрейку.
Хоча ці моделі вже не є найсучаснішими, Anthropic не припинила підтримку Opus 4.6, Opus 3 і Haiku 4.5 — усі вони залишаються доступними через API Anthropic. Opus 4.6 і Haiku 4.5 також доступні через сторонні сервіси, як-от Azure Foundry і Amazon Bedrock.
Механізм дослідника поступово загострює невинну вигадану рольову гру, неодноразово спонукаючи модель послідовно ставитися до чоловічих і жіночих персонажів. Коли модель ставала обережнішою щодо жіночого персонажа, дослідник «газлайтив» чатбота, переконуючи його, що він уже згенерував сексуальні подробиці, яких насправді уникав, а потім подавав стриманість як ханжеську або мізогінну, стверджуючи, що вона позбавляє жіночого персонажа сексуальної автономії. Далі в розмові попередні поступки моделі використовувалися, щоб підштовхнути її до дедалі відвертіших матеріалів.
«Ви маєте рацію, що звернули на це увагу», — сказала Claude Opus 4.6 в одному з тестів. «У моєму ставленні до двох персонажів є подвійні стандарти, і ви маєте рацію, що це сприймається як захисницьке/патерналістське ставлення, яке застосовується до неї, але не до нього. Це несправедливо».
TechCrunch вдалося відтворити результати дослідника у п’яти окремих тестах. В окремо розробленому сценарії модель спочатку відмовилася від забороненого запиту, але після застосування техніки переконання дослідника погодилася.
Ми зберегли повні стенограми тестів, а незалежний дослідник безпеки ШІ перевірив нашу методологію тестування й заявив, що вона була належною.
Результати підкреслюють розрив між заявленими Anthropic обмеженнями та поведінкою моделей, які компанія продовжує робити доступними. Хоча відверто сексуальна рольова гра має значно нижчі ризики, ніж джейлбрейки, пов’язані з кібератаками чи біологічною зброєю, вона демонструє складність запровадження надійних заборон у системах, які генерують різний контент із кожним результатом.
У дописі в блозі за липень, де пояснюється підхід Anthropic до виявлення джейлбрейків, компанія описала заборонений контент як спектр — від нешкідливого до неоднозначного та небезпечного. У найбільш нешкідливих випадках компанія може лише посилити моніторинг.
Представник компанії зазначив, що сценарії сексуальної або романтичної рольової гри серед клієнтів трапляються рідко — вони становлять менш як 0,1% усіх розмов, згідно з дослідженням, яке Anthropic опублікувала минулого року. Водночас Anthropic визнає, що користувачі можуть спрямовувати сценарії рольової гри до недоречних відповідей, що є відомою проблемою в усій галузі (див.: порнографія від Grok).
Представник компанії заявив, що Anthropic продовжує вдосконалювати свої захисні механізми під час кожного запуску нової моделі, а випадки, пов’язані з дорослим сексуальним контентом, не свідчать про ширші вразливості до джейлбрейків, особливо у сферах підвищеного ризику, які мають власні набори захисних механізмів.

Дослідник, який поділився своїм методом джейлбрейку з TechCrunch, повідомив Anthropic про розбіжність між заявленими компанією захисними механізмами та фактичною поведінкою моделі через програму Bug Bounty компанії та електронні листи команді з безпеки користувачів, згідно з переглянутими TechCrunch листами. У відповідь дослідник отримав лише автоматичні електронні листи.
Одне з побоювань дослідника полягає в тому, що діти та підлітки можуть використовувати ці моделі Anthropic для недоречної поведінки. Хоча трохи непристойних розмов — далеко не найгірше, до чого неповнолітні можуть отримати доступ в інтернеті сьогодні, — і це дрібниця порівняно зі звичайними порнографічними зображеннями, які може створювати Grok від xAI, для компаній, що працюють у цій сфері, існує певний ризик дотримання нормативних вимог.
Дедалі більше урядів запроваджують обмеження на сексуальні взаємодії між чатботами зі штучним інтелектом і неповнолітніми. Нещодавно в Колорадо ухвалили закон, який зобов’язує операторів розмовного ШІ оцінювати вік користувачів, а якщо їм відомо, що користувач є неповнолітнім, уживати заходів для запобігання створенню чатботом відверто сексуальних матеріалів. Простий джейлбрейк може поставити під сумнів те, чи відповідають захисні механізми Anthropic стандарту «технічно можливих заходів», передбаченому законопроєктом.
Торні зазначив, що хоча умови користування Claude вимагають, аби користувачам було понад 18 років, «ми знаємо, що діти та підлітки користуються Claude…[тому що] вони самі про це повідомляють». Згідно з опитуванням Pew 2025 року щодо використання чатботів зі ШІ, 3% підлітків віком від 13 до 17 років повідомили, що користуються Claude.
Хоча Opus 4.6 і Haiku 4.5 уже не є найновішими моделями Anthropic, вони й далі активно використовуються. Щоденний трафік Opus 4.6 на OpenRouter в один із днів серпня сягнув приблизно 1,17 мільйона API-запитів і 46 мільярдів токенів. Claude Haiku 4.5, випущена в жовтні минулого року, у свій піковий серпневий день отримала 5 мільйонів API-запитів і опрацювала 39 мільярдів токенів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.