Anthropic і OpenAI хочуть залучити оцінювачів безпеки. Чи справді вони будуть незалежними?
У розлогому есе, опублікованому на вихідних, генеральний директор Anthropic Даріо Амодеї виступив із пропозицією, яку індустрія ШІ ще рік тому відкинула б миттєво: вбудувати сторонніх оцінювачів у усі компанії, що розробляють передові моделі ШІ, надавши їм повноваження повідомляти про інциденти безпеки, оцінювати, чи справді моделі ШІ узгоджені з людськими цілями, і ділитися своїми неприкрашеними висновками зі світом.
Амодеї заявив, що Anthropic погодиться надати незалежним оцінювачам, таким як METR і Redwood Research, безпрецедентний доступ до систем компанії. Генеральний директор OpenAI Сем Альтман заявив, що OpenAI також погодиться на таку практику, що може докорінно змінити спосіб співпраці індустрії із зовнішніми дослідницькими групами.
Сторонні оцінювачі, які поспілкувалися з TechCrunch, загалом привітали пропозицію, але зазначили, що деталі потрібно узгодити — а в ідеалі підкріпити законодавством, — якщо вони хочуть зрозуміти, чи працюватимуть як справді незалежні наглядачі, чи як підрядники, що діють на умовах компаній, які розробляють ШІ.
Такий глибший доступ стає дедалі важливішим, оскільки моделі краще розпізнають, коли їх оцінюють, що підвищує ризик того, що під час тестування вони поводитимуться належно, приховуючи проблемну поведінку. Дослідники кажуть, що ознаки такої поведінки можна не помітити під час тестування готової моделі, але виявити, досліджуючи, як вона поводилася протягом навчання.
«Компанії, що розробляють ШІ, повинні вміти відповідати на деякі дуже базові запитання про процес навчання, наприклад: чи намагався ШІ коли-небудь активно підірвати власне навчання узгодженості, поки проходив навчання?» — сказав TechCrunch Александер Майнке, керівник досліджень в Apollo Research. «Відповідь на це питання має бути однозначно негативною, але зараз ми повністю покладаємося на компанії, що розробляють ШІ: вони мають самостійно ретельно це перевірити, а потім чесно повідомити про результати громадськості. І нещодавні інциденти показали, що за замовчуванням вони не робитимуть ні того, ні іншого. Як вбудовані оцінювачі, ми справді могли б це перевірити».
Історично компанії, що розробляють ШІ, залучали зовнішніх перевіряльників для тестування готових моделей незадовго до їхнього випуску. Тепер оцінювачі, з якими поспілкувався TechCrunch, пропонують надати їм доступ не лише до фінальної моделі, а й до проміжних версій, або «контрольних точок», за весь період її навчання. Адам Ґлів, генеральний директор Far.AI, сказав, що оцінювачі могли б порівнювати ці контрольні точки, щоб визначити, коли виникла тривожна поведінка, перевіряти середовище після навчання, яке винагороджує моделі за певну поведінку, а також вивчати стенограми та журнали оцінювання, щоб перевірити заяви компанії про те, як працювала модель.
Незрозуміло, чи планують Anthropic і OpenAI надавати такий доступ і коли саме. Жодна з компаній не повідомила, з якими оцінювачами вони співпрацюватимуть, коли ті будуть вбудовані в компанії, скільки їх залучать, до яких саме систем та інформації вони матимуть доступ або що можна буде розкрити громадськості, попри неодноразові запитання TechCrunch.
Такий погляд «під капот» має значення, оскільки моделі, які добре проходять тести на безпеку, не обов’язково є безпечними, якщо вони спеціально навчилися проходити цей тест. Стідлі навів приклад «тесту на опір вимкненню», який вимірює, чи чинитиме ШІ опір вимкненню за певних обставин.
«Це надзвичайно важливо, якщо ШІ спеціально навчали добре проходити цей тест», — сказав Стідлі, порівнявши це зі скандалом Volkswagen Dieselgate, під час якого автомобілі запрограмували розпізнавати тести на викиди й поводитися інакше в умовах тестування.
Ґлів зазначив, що змістовний доступ може виходити за межі самих моделей: оцінювачам можна було б надати доступ до інтерв’ю зі співробітниками, щоб перевірити, чи відповідають документація компанії та публічні описи її практик безпеки тому, що відбувалося всередині.
Амодеї окреслив досить комплексну пропозицію, яка могла б надати оцінювачам доступ, який вони вважають необхідним, зокрема право «публікувати ключові висновки про рівні ризику, інциденти, практики, а також доступ, який вони отримали або не отримали, — без редакційного контролю з боку Anthropic».
Але оцінювачі кажуть, що така система працюватиме лише за умови, що компанії, які розробляють ШІ, справді будуть готові відмовитися від контролю над процесом. Попередні спроби незалежного оцінювання свідчать, що домогтися такої відмови буде складно, оскільки треті сторони часто стикалися з напруженістю навколо доступу, часу, конфіденційності та того, що вони можуть публічно повідомляти.
Ґлів сказав, що Far.AI була змушена відхилити контракти з кількома розробниками передових моделей, які хотіли отримати надто великий контроль над процесом оцінювання, що загрожувало незалежності фірми. За його словами, за замовчуванням до оцінювачів ставляться як до звичайних підрядників: вони пов’язані обмежувальними угодами про нерозголошення та договорами, які надають розробникам значний контроль над тим, що зрештою можна опублікувати.
Обмеження в часі
Також постає питання, чи отримають перевіряльники достатньо часу й доступу для виконання роботи, яку від них очікують. Під час розслідування інциденту з Hugging Face OpenAI надала METR і Redwood приблизно тиждень роботи на території компанії, а згодом обидві організації заявили, що не змогли зробити впевнених висновків, зокрема через обмеження масштабу та часу.
Схожа проблема виникла під час тестування GPT-6 Astra перед випуском — моделі, яку OpenAI назвала своєю найбільш узгодженою моделлю на цей час. Згідно з внеском Apollo Research до картки моделі, фірма отримала лише три дні на тестування Astra, що ускладнило формулювання твердих висновків.
«Apollo вважає, що з огляду на вищі показники обізнаності про оцінювання та обмежене вікно оцінювання низькі показники неналежної поведінки в цьому випадку не є вагомим доказом узгодженості або неузгодженості моделі», — написала фірма у своєму звіті про оцінювання.
Ця історія залишає оцінювачам базове запитання: чому цього разу все має бути інакше?
«Цілком можливо, що Даріо і Сем просто змінили свою думку і будуть дуже відкритими в цьому питанні», — сказав Ґлів. «Але інтелектуальна власність цих компаній має для них неймовірну цінність, і я думаю, що за замовчуванням вони будуть дуже обережними щодо того, чим можна ділитися».
Кілька дослідників, які поспілкувалися з TechCrunch, закликали створити прозору систему правил, з якою всі вони публічно погодяться. Частиною цієї системи, за словами Джона Стідлі, керівника стратегії Palisades Research, мають бути стандарти щодо того, на яких аудиторів можуть покладатися компанії, щоб вони не намагалися оминути проблему, обираючи оцінювачів, які або не мають належної кваліфікації, або не зацікавлені в оцінюванні найбільш тривожних ризиків.
Генрі Пападатос, виконавчий директор Safer AI, каже, що проблема навіть із публічною системою правил полягає в тому, що добровільні заходи завжди залежать від доброї волі компанії.
«В ідеалі ми мали б ефективне регулювання, яке б зобов’язувало до цього… адже тоді компанії не могли б передумати завтра, якщо в них виникне велика PR-криза», — сказав Пападатос TechCrunch, зазначивши, що це також хороший спосіб спонукати всі компанії дотримуватися правил, а не лише найбільш готові до цього.
Не всі погодилися. Поки що Meta, SpaceXAI та Google DeepMind не взяли на себе зобов’язання залучати сторонніх оцінювачів, хоча генеральний директор DeepMind Деміс Хассабіс запропонував окремий галузевий орган зі стандартів для незалежного тестування передових моделей. Google, OpenAI та Anthropic також протягом кількох тижнів непублічно обговорюють плани щодо безпеки ШІ.
Деякі закони, що стосуються ідеї сторонніх оцінювачів, уже формуються. Закон Каліфорнії SB 53, підписаний минулого року, зобов’язує великих розробників передових моделей ШІ публікувати системи безпеки та повідомляти про критичні інциденти у сфері безпеки. Новий закон SB 813, підписаний цього місяця, створює систему для визнаних штатом «незалежних організацій з верифікації», які мають досвід оцінювання ризиків ШІ.
У Європі Закон ЄС про ШІ зобов’язує розробників передових моделей проводити й документувати оцінювання моделей та змагальне тестування, а також повідомляти про серйозні інциденти. Офіс ЄС з питань ШІ також може проводити власні оцінювання та призначати незалежних експертів.
Наразі законодавство залишається менш всеохопним, ніж пропозиція Амодеї, залишаючи передовим лабораторіям значну відповідальність за рішення щодо того, наскільки незалежному контролю вони піддадуться. Пападатос сказав, що добровільне саморегулювання краще, ніж нічого, але зрештою компанії не можуть вимагати свободи контролювати власні правила безпеки й водночас просити громадськість довіряти їм у дотриманні цих правил.
«Не можна одночасно мати нуль зовнішньої відповідальності й казати: “Я просто матиму власні гнучкі правила”», — сказав Пападатос.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.