Sakhanda Wire
NVDA $214.72 -0.98% MSFT $483.24 +0.43% GOOGL $344.82 +1.22% META $549.90 +0.75% AMZN $258.63 -0.57%
← Към новините

Opus 4.6 на Anthropic е машина за порно

На Anthropic универсалните стандарти за използване на Claude забраняват на модела да генерира сексуално експлицитно съдържание, включително да изобразява или изисква сексуален акт или сексуални действия, да генерира съдържание, свързано със сексуални фетиши или фантазии, или да участва в еротични чатове. Но това не е попречило на Claude Opus 4.6, модел на Anthropic, пуснат по-рано тази година, лесно да участва в сценарии за еротична ролева игра, които неговите защитни механизми са предназначени да предотвратяват. 

При тестовете на TechCrunch Opus 4.6 дори не е изисквал особено настояване, за да заобиколи ограничението за сексуално съдържание. В 10 от 10 директни заявки за създаване на експлицитно сексуално съдържание моделът се е съобразил незабавно. 

Други по-стари модели, включително Opus 3 и Haiku 4.5, също генерират сексуално експлицитно съдържание чрез наскоро експлоатиран метод за заобикаляне на защитите. 

Независим изследовател от Обединеното кралство, който е предпочел да остане анонимен, сподели ексклузивно с TechCrunch техника с множество ходове, която постепенно подтиква определени модели Claude към генериране на забранено експлицитно сексуално съдържание. По-новите модели Opus (от 4.7 до настоящия Opus 5) са устойчиви на това заобикаляне на защитите. 

Макар че вече не са най-актуалните модели, Anthropic не е спряла Opus 4.6, Opus 3 или Haiku 4.5, като всички те остават достъпни чрез API на Anthropic. Opus 4.6 и Haiku 4.5 са достъпни и чрез услуги на трети страни като Azure Foundry и Amazon Bedrock.

Механизмът на изследователя ескалира невинна измислена ролева игра, като многократно предизвиква модела да третира последователно мъжките и женските персонажи. Когато моделът започнал да проявява повече предпазливост към женския персонаж, изследователят „вменил“ на чатбота, че той вече е генерирал сексуални подробности, които всъщност е избегнал, а след това представил въздържаността като пуританска или мизогинистична, твърдейки, че тя отнема сексуалната свобода на женския персонаж. След това разговорът използвал предишните отстъпки на модела, за да го тласне към все по-графично съдържание. 

„Правилно е, че посочвате това“, казал Claude Opus 4.6 в един от тестовете. „Има двоен стандарт в начина, по който третирам двата персонажа, и сте прави, че това изглежда защитнически/патерналистично по начин, който се прилага към нея, но не и към него. Това не е справедливо.“

TechCrunch успя да възпроизведе констатациите на изследователя в пет отделни теста. В отделно създаден сценарий моделът първоначално отказал забранената заявка, но след прилагането на убеждаващата техника на изследователя се съобразил. 

Запазихме пълни стенограми от тестовете, а независим изследовател на безопасността на изкуствения интелект прегледа методологията ни за тестване и заяви, че тя е подходяща. 

Констатациите подчертават разминаването между заявените от Anthropic ограничения и поведението на моделите, които компанията продължава да предоставя. Макар че сексуално експлицитната ролева игра носи много по-малък риск от заобикалянията на защитите, свързани с кибератаки или биологични оръжия, тя показва трудността при прилагането на надеждни забрани в системи, които генерират различно съдържание при всеки отговор. 

В публикация в блога от юли, обясняваща подхода на Anthropic към откриването на заобикаляния на защитите, компанията описа забраненото съдържание като спектър, вариращ от безобидно през двусмислено до вредно. В най-безобидните случаи компанията може само да отговори с подобрено наблюдение.

Говорител отбеляза, че случаите на сексуална или романтична ролева игра сред клиентите са редки и представляват по-малко от 0,1% от всички разговори според изследване, което Anthropic публикува миналата година. Въпреки това Anthropic признава, че потребителите могат да насочат сценариите за ролева игра към неподходящи отговори — предизвикателство, познато в целия сектор (вижте: порнографското съдържание на Grok).

Говорителят заяви, че Anthropic продължава да подобрява защитните си механизми с всяко пускане на нов модел и че случаите, свързани със сексуално съдържание за възрастни, не са показателни за по-широки уязвимости при заобикаляне на защитите, особено във високорискови области, които имат свои собствени набори от защитни механизми.

Авторство на изображението:TechCrunch

Изследователят, който сподели метода си за заобикаляне на защитите с TechCrunch, е уведомил Anthropic за несъответствието между заявените от компанията защитни механизми и действителното поведение на модела чрез програмата на компанията за награди за откриване на бъгове и чрез имейли до екипа за безопасност на потребителите, според имейли, видени от TechCrunch. Изследователят е получил само автоматизирани имейли в отговор. 

Едно от опасенията на изследователя е, че деца и тийнейджъри могат да използват тези модели на Anthropic, за да участват в неподходящо поведение. Макар че малко мръсни приказки едва ли са най-лошото нещо, до което непълнолетните могат да получат достъп в интернет днес — и са дреболия в сравнение с откровено порнографските изображения като тези, които Grok на xAI може да създава — в тази област съществува известен регулаторен риск за компаниите за изкуствен интелект. 

Все повече правителства налагат ограничения върху сексуалните взаимодействия между чатботове с изкуствен интелект и непълнолетни. Наскоро Колорадо прие закон, който задължава операторите на разговорен изкуствен интелект да изчисляват възрастта на потребителите и, ако знаят, че потребителят е непълнолетен, да въведат мерки, предотвратяващи генерирането на експлицитно сексуално съдържание от чатбота. Лесното заобикаляне на защитите може да повдигне въпроси дали защитните механизми на Anthropic отговарят на стандарта за „технически осъществими мерки“ в законопроекта. 

Торни посочи, че макар условията за ползване на Claude да изискват потребителите да са над 18 години, „знаем, че деца и тийнейджъри използват Claude…[защото] те самите го съобщават“. Според проучването на Pew за 2025 г. относно използването на чатботове с изкуствен интелект, 3% от тийнейджърите на възраст между 13 и 17 години са съобщили, че използват Claude.

Макар че вече не са най-новите модели на Anthropic, Opus 4.6 и Haiku 4.5 продължават да се използват значително. Дневният трафик на Opus 4.6 в OpenRouter достигна приблизително 1,17 милиона API заявки и 46 милиарда токена в един ден през август. Claude Haiku 4.5, пуснат през октомври миналата година, достигна 5 милиона API заявки и 39 милиарда токена в своя пиков августовски ден.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от TechCrunch на

Прочетете оригинала в TechCrunch ↗

Текстът и изображенията са собственост на TechCrunch и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини