Anthropic разкрива повече подробности за това как ще работят новите водни знаци на Claude
Anthropic публикува публикация в блога си в петък, в която се опитва да отговори на някои основни въпроси относно начина, по който ще поставя водни знаци върху текста, генериран от чатбота ѝ Claude. Например: Как всъщност ще работи поставянето на водни знаци? Могат ли те да бъдат скрити чрез редактиране? И как това се отразява на кода?
Потребителите на Claude обсъждат този ход, откакто компанията разкри по-рано тази седмица, че ще поставя водни знаци, за да спази Кодекса за прозрачност на Закона на ЕС за изкуствения интелект, който изисква компаниите за изкуствен интелект да използват системи, позволяващи идентифицирането на генерирано от ИИ съдържание.
В Reddit например един потребител определи това като конспирация срещу невинните потребители на Claude, докато друг заяви: „Единствената причина да не искаш това е, ако искаш да лъжеш хората.“ А Business Insider съобщава, че „десетки“ потребители в X са заявили, че са отменили абонаментите си за Claude в резултат на това.
Новата публикация на Anthropic започва с общ преглед на концепцията за водните знаци, като обяснява, че при „избори с малък залог“ — например при избора между думите „облачно“ и „сиво“, за да се опише времето — Claude може да създаде модел в отговорите си, който е „недоловим за читателя, но е откриваем от всеки, който разполага с ключ, кодиращ този модел“.
„Поставянето на водни знаци не влияе върху качеството на резултатите от Claude“, заяви компанията. „За читателя отговорът с воден знак не се различава от отговор без воден знак.“
По-конкретно Anthropic заяви, че ще използва подхода SynthID-Text, който екипът на Google DeepMind представи през 2024 г., и че планира да пусне API за откриване на водни знаци. Компанията също така отбеляза, че поставянето на водни знаци се различава от предлаганите от компании като Pangram подходи за откриване на ИИ, които търсят „подсказки“ в текста (като конструкцията „това не е [X], а е [Y]“), за да разкрият използването на ИИ: „Улавянето на тези модели е фундаментално различно от проверката за воден знак.“
Може ли някой просто да пренапише текста, за да скрие водния знак? Anthropic заяви, че това е възможно, но „лекото редактиране вероятно няма да премахне водния знак напълно“, докато „пълното пренаписване, при което всяка дума е заменена, ще го премахне“.
„В последния случай, разбира се, може да се спори дали текстът все още може да бъде описан като генериран от ИИ“, заяви компанията.
Що се отнася до това дали водният знак ще бъде откриваем в текст, който е бил само коригиран или редактиран от Claude, Anthropic заяви, че това ще зависи от „дължината на текста и от степента, в която Claude го е редактирал“. Ако е бил само леко редактиран, „почти всички думи“ ще са написани от човешкия автор и „няма да има почти нищо (ако изобщо има нещо), към което водният знак да се прикрепи“.
Междувременно кодът би трябвало да съдържа по-слабо изразен воден знак от останалия текст, тъй като моделът ще трябва да създаде работещ код и няма да разполага със свободата да избира между множество еднакво валидни варианти.
„Като казваме това, в области, в които има произволен избор между конкретни думи или термини в кода, водният знак може да бъде използван, например в коментарите в кода“, заяви Anthropic. „Но по дефиниция той ще има пренебрежимо малък ефект върху действително създадения код.“
Anthropic също така заяви, че Claude няма да бъде единственият чатбот с изкуствен интелект, който генерира текст с водни знаци, тъй като „други водещи разработчици на модели са подписали същия Кодекс за практиките и ще прилагат свои собствени водни знаци“.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.