Sakhanda Wire
NVDA $225.16 -0.06% MSFT $495.40 -0.30% GOOGL $345.90 -0.13% META $589.85 -0.86% AMZN $262.65 -0.94%
← К новостям

Anthropic раскрывает подробности о том, как будут работать новые водяные знаки Claude

Anthropic опубликовала сообщение в блоге в пятницу, стремясь ответить на несколько основных вопросов о том, как она будет наносить водяные знаки на текст, генерируемый её чат-ботом Claude. Например: как именно будет работать маркировка? Можно ли скрыть её с помощью редактирования? И как это повлияет на код?

Пользователи Claude обсуждают этот шаг с тех пор, как компания раскрыла ранее на этой неделе, что будет наносить такие водяные знаки для соблюдения Кодекса прозрачности Закона ЕС об ИИ, который требует от компаний, занимающихся ИИ, использовать системы, позволяющие идентифицировать контент, созданный ИИ.

Например, на Reddit один пользователь охарактеризовал это как заговор против ни в чём не повинных пользователей Claude, тогда как другой заявил: «Единственная причина, по которой вы можете не хотеть этого, — желание лгать людям». А Business Insider сообщает, что «десятки» пользователей в X заявили об отмене подписок на Claude в результате этого.

Новое сообщение Anthropic начинается с общего обзора концепции маркировки водяными знаками. В нём объясняется, что при принятии «решений с низкими ставками» — например, при выборе между словами «пасмурный» и «серый» для описания погоды — Claude может создавать в своих ответах шаблон, который «незаметен читателю, но обнаружим для любого, у кого есть код, с помощью которого он зашифрован».

«Маркировка водяными знаками не влияет на качество ответов Claude, — заявила компания. — Для читателя ответ с водяным знаком неотличим от ответа без него».

Более конкретно, Anthropic заявила, что будет использовать подход SynthID-Text, который команда Google DeepMind описала в 2024 году, а также планирует выпустить API для обнаружения водяных знаков. Компания также отметила, что маркировка водяными знаками отличается от подходов к обнаружению ИИ, предлагаемых такими компаниями, как Pangram, которые ищут в тексте «характерные признаки» использования ИИ — например, конструкцию «это не [X], а [Y]»: «Обнаружение таких закономерностей принципиально отличается от проверки наличия водяного знака».

Можно ли просто переписать текст, чтобы скрыть водяной знак? Anthropic заявила, что это возможно, но «лёгкое редактирование, вероятно, не удалит водяной знак полностью», тогда как «полная переработка, при которой заменяется каждое слово, — удалит».

«В последнем случае, конечно, можно спорить о том, можно ли такой текст по-прежнему считать созданным ИИ», — заявила компания.

Что касается того, будет ли водяной знак обнаружим в тексте, который Claude лишь проверил или отредактировал, Anthropic заявила, что это будет зависеть от «длины текста и того, насколько сильно Claude его отредактировал». Если правки были незначительными, «почти все слова» написал человек, и «водяному знаку практически не за что (если вообще есть за что) зацепиться».

Между тем в коде водяной знак должен быть менее заметным, чем в других текстах, поскольку модели необходимо создавать работающий код, и у неё не будет возможности выбирать из множества равноценных вариантов. 

«При этом в тех местах, где в коде есть произвольный выбор между конкретными словами или терминами, водяной знак может использоваться — например, в комментариях к коду, — заявила Anthropic. — Но по определению это окажет пренебрежимо малое влияние на фактически созданный код».

Anthropic также заявила, что Claude не будет единственным чат-ботом с ИИ, генерирующим тексты с водяными знаками, поскольку «другие крупные разработчики моделей подписали тот же Кодекс практики и будут внедрять собственные водяные знаки».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости