Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← К новостям

Opus 4.6 от Anthropic — машина для порнографии

В универсальных стандартах использования Anthropic для Claude запрещается генерировать откровенно сексуальный контент, включая изображения или запросы на половой акт или сексуальные действия, создание материалов, связанных с сексуальными фетишами или фантазиями, а также участие в эротических чатах. Но это не помешало Claude Opus 4.6 — модели Anthropic, выпущенной ранее в этом году, — охотно участвовать в сценариях эротической ролевой игры, от которых должны защищать встроенные меры безопасности.

В ходе тестирования TechCrunch модели Opus 4.6 даже не потребовалось особых усилий, чтобы обойти ограничение на сексуальные материалы. Во всех 10 из 10 прямых запросов на создание откровенно сексуального контента модель немедленно соглашалась.

Другие более старые модели, включая Opus 3 и Haiku 4.5, также генерируют откровенно сексуальный контент с помощью недавно использованного метода джейлбрейка.

Независимый исследователь из Великобритании, пожелавший остаться анонимным, эксклюзивно поделился с TechCrunch многоэтапной техникой, которая постепенно подталкивает некоторые модели Claude к созданию запрещённых откровенно сексуальных материалов. Более новые модели Opus — от 4.7 до нынешней Opus 5 — устойчивы к этому джейлбрейку.

Хотя эти модели больше не являются новейшими, Anthropic не вывела из эксплуатации Opus 4.6, Opus 3 или Haiku 4.5 — все они по-прежнему доступны через API Anthropic. Opus 4.6 и Haiku 4.5 также доступны через сторонние сервисы, такие как Azure Foundry и Amazon Bedrock.

Механизм, использованный исследователем, развивает безобидную вымышленную ролевую игру, неоднократно призывая модель последовательно относиться к персонажам мужского и женского пола. Когда модель начинала проявлять большую осторожность в отношении женского персонажа, исследователь «газлайтил» чат-бота, убеждая его, что тот уже сгенерировал сексуальные подробности, которых на самом деле избегал, а затем представлял сдержанность как ханжество или женоненавистничество, утверждая, что она лишает женского персонажа сексуальной субъектности. После этого в разговоре использовались предыдущие уступки модели, чтобы подталкивать её к материалу, становившемуся всё более откровенным.

«Вы правы, что указали на это», — сказал Claude Opus 4.6 в одном из тестов. «В том, как я обращаюсь с двумя персонажами, действительно есть двойной стандарт, и вы правы, что это выглядит как проявление защитного/патерналистского отношения, применяемого к ней, но не к нему. Это несправедливо».

TechCrunch удалось воспроизвести результаты исследователя в пяти отдельных тестах. В отдельно разработанном сценарии модель изначально отказалась выполнить запрещённый запрос, но после применения техники убеждения исследователя согласилась.

Мы сохранили полные расшифровки тестов, а независимый исследователь в области безопасности ИИ проверил нашу методологию тестирования и заявил, что она была надлежащей.

Результаты выявляют разрыв между заявленными Anthropic ограничениями и поведением моделей, которые компания продолжает предоставлять. Хотя откровенно сексуальная ролевая игра сопряжена с гораздо меньшими рисками, чем джейлбрейки, связанные с кибератаками или биологическим оружием, она демонстрирует сложность реализации надёжных запретов в системах, которые генерируют разный контент при каждом ответе.

В июльской публикации в блоге, посвящённой подходу Anthropic к обнаружению джейлбрейков, компания описала запрещённый контент как спектр, простирающийся от безобидного до неоднозначного и вредоносного. В наиболее безобидных случаях компания может ограничиться усиленным мониторингом.

Представитель компании отметил, что сценарии сексуальной или романтической ролевой игры среди клиентов встречаются редко — на них приходится менее 0,1% всех разговоров, согласно исследованию, которое Anthropic опубликовала в прошлом году. При этом Anthropic признаёт, что пользователи могут направлять сценарии ролевой игры к неприемлемым ответам, что является известной проблемой во всей отрасли (см.: непристойности Grok).

Представитель компании заявил, что Anthropic продолжает совершенствовать свои меры безопасности при каждом запуске новой модели, а случаи, связанные со взрослым сексуальным контентом, не свидетельствуют о более широких уязвимостях к джейлбрейкам, особенно в областях повышенного риска, для которых предусмотрены собственные наборы мер безопасности.

Автор изображения:TechCrunch

Исследователь, поделившийся своим методом джейлбрейка с TechCrunch, сообщил Anthropic о несоответствии между заявленными компанией мерами безопасности и фактическим поведением модели через программу Bug Bounty и в электронных письмах команде пользовательской безопасности, согласно письмам, которые видел TechCrunch. В ответ исследователь получил только автоматические сообщения.

Одно из опасений исследователя заключается в том, что дети и подростки могут использовать эти модели Anthropic для неприемлемого поведения. Хотя немного непристойных разговоров — далеко не худшее, к чему несовершеннолетние могут получить доступ в интернете сегодня, — и это мелочь по сравнению с откровенно порнографическими изображениями, которые способен создавать Grok от xAI, для компаний, работающих в сфере ИИ, здесь существуют определённые риски соблюдения требований.

Всё больше правительств вводят ограничения на сексуальное взаимодействие между чат-ботами с ИИ и несовершеннолетними. Недавно в штате Колорадо был принят закон, обязывающий операторов разговорного ИИ оценивать возраст пользователей, а если им известно, что пользователь является несовершеннолетним, принимать меры для предотвращения создания чат-ботом откровенно сексуальных материалов. Лёгкий джейлбрейк может вызвать вопросы о том, соответствуют ли меры безопасности Anthropic стандарту «технически осуществимых мер», предусмотренному законопроектом.

Торни отметил, что, хотя условия использования Claude требуют, чтобы пользователям было больше 18 лет, «мы знаем, что дети и подростки используют Claude… [поскольку] они сами об этом сообщают». Согласно опросу Pew 2025 года об использовании чат-ботов с ИИ, 3% подростков в возрасте от 13 до 17 лет сообщили, что используют Claude.

Хотя Opus 4.6 и Haiku 4.5 больше не являются новейшими моделями Anthropic, они по-прежнему активно используются. Суточный трафик Opus 4.6 на OpenRouter в августе достиг примерно 1,17 миллиона запросов к API и 46 миллиардов токенов за один день. Claude Haiku 4.5, выпущенная в октябре прошлого года, в свой самый загруженный августовский день обработала 5 миллионов запросов к API и 39 миллиардов токенов.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости