OpenAI додаватиме водяні знаки до текстів ChatGPT у ЄС, але зробить їх необов’язковими для користувачів API по всьому світу
OpenAI додає невидимі водяні знаки до текстів ChatGPT, щоб відповідати правилам ЄС. На відміну від Anthropic, компанія дозволить клієнтам API по всьому світу вимикати їх.
Як повідомляється, Закон ЄС про штучний інтелект вимагає від постачальників ШІ маркувати згенерований текст у машиночитному форматі. Відповіддю OpenAI стала технологія textGrain, яка вбудовує невидимий статистичний сигнал у вибір слів моделлю. Вона працює майже так само, як водяний знак SynthID від Claude, який використовує технологію Google з відкритим кодом.
OpenAI заявляє, що протягом найближчих тижнів увімкне водяні знаки для користувачів ChatGPT і Codex у Європейському Союзі. Водяні знаки в API будуть доступні по всьому світу за принципом добровільного підключення, на відміну від обов’язкових водяних знаків Anthropic для Claude, які застосовуються глобально незалежно від способу доступу користувачів до моделей. Водяні знаки OpenAI в API також стануть доступними через хмарних партнерів, таких як Microsoft Azure, протягом найближчих тижнів.
Редагування тексту різко знижує рівень виявлення
OpenAI стверджує, що textGrain у внутрішніх тестах не поступалася іншим підходам або перевершувала їх, зокрема SynthID для тексту від Google. Компанія також планує опублікувати технологію у відкритому доступі, щоб інші могли розвивати її.
Рівень виявлення значною мірою залежить від довжини тексту та його тематики. Якщо детектор налаштований на цільовий рівень хибнопозитивних результатів у 1 відсоток, він виявив водяні знаки приблизно у 95 відсотках фрагментів про психологію обсягом 400 токенів. Для 200 токенів цей показник знизився приблизно до 80 відсотків.
За словами OpenAI, для математичного контенту рівень виявлення був «істотно нижчим», оскільки модель має менше свободи у виборі слів. Довші фрагменти можуть посилити статистичний сигнал і покращити виявлення, хоча результати все одно можуть залежати від змісту. OpenAI не надає даних для перевірки цього припущення.

Редагування тексту також ускладнює виявлення водяного знака. OpenAI стверджує, що заміна лише 10 відсотків слів синонімами знижує рівень виявлення для фрагментів обсягом 400 токенів приблизно з 92 до 66 відсотків. Заміна чверті слів знижує рівень виявлення до 17 відсотків, через що водяний знак легко обійти. Ця слабкість може зіграти на користь OpenAI. Користувачі, які не хочуть, щоб використання ними ChatGPT виявляли, можуть перейти на моделі з відкритими вагами, якщо водяні знаки стане важче видаляти.

Технічний звіт докладно пояснює принцип роботи textGrain. Anthropic не публікувала показники виявлення для водяного знака Claude, хоча стверджує, що її система добре витримує редагування.
OpenAI заявляє, що водяні знаки не погіршують якість результатів, посилаючись на тести своєї передової моделі Astra. Компанія не виявила значних відмінностей у продуктивності з увімкненими або вимкненими водяними знаками у восьми тестах, зокрема GPQA Diamond, BrowseComp і DeepSWE. Ці результати не встановлюють, чи впливають водяні знаки на якість написання тексту — це питання критики також порушували щодо водяного знака Claude.
OpenAI також зазначає, що виявлений водяний знак нічого не говорить про обсяг людської творчості чи редагування, вкладених у текст. Він не встановлює право власності, не визначає відповідальність, не ідентифікує користувача й не показує, чи є текст точним; так само невиявлення водяного знака не доводить, що текст написала людина. Фрагмент може бути надто коротким, відредагованим або перекладеним, чи походити від моделі, яку детектор не підтримує.
OpenAI поки що обмежить доступ до детектора
Спочатку доступ до детектора textGrain отримають лише окремі дослідники та спеціалізовані організації. Вони можуть подати заявку через форму заявки. OpenAI надаватиме доступ у кожному випадку окремо відповідно до Кодексу практики ЄС. Anthropic застосовує подібний підхід зі своїм API виявлення.
Інструмент повідомлятиме лише про те, чи виявив він водяний знак OpenAI. Він не ідентифікуватиме користувачів і не розкриватиме їхні запити чи розмови.
OpenAI заявляє, що обмежує доступ, оскільки детектор може позначати немаркований текст або не виявляти водяні знаки. Компанія планує розширити доступ «коли ми вважатимемо, що результати можна відповідально інтерпретувати». Коли саме це станеться, вона не повідомила.
Наявні інструменти перевірки зображень і аудіо залишаються загальнодоступними, зокрема openai.com/verify і Content Provenance API.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.