Пілотування перших у світі подвійно сліпих оцінювань ШІ
Вільям Айзек, Сол Мессінг і Крістіан Лум
Формування довіри до пропрієтарних тестів моделей за допомогою криптографічно захищених середовищ
Уявімо, що студент має скласти важливий іспит. Якщо він випадково підгляне запитання тесту заздалегідь, знання відповідей вплине на його ідеальний результат, зробивши це досягнення беззмістовним. Щоб по-справжньому виміряти його знання, він не повинен бачити запитання тесту до початку іспиту. Саме з таким викликом стикається індустрія під час оцінювання передових моделей ШІ. Якщо модель уже бачила запитання тесту — проблема, відома як забруднення тесту, — результатам можна довіряти лише певною мірою.
Сьогодні ми представляємо перше у світі подвійно сліпе оцінювання пропрієтарної моделі ШІ передового класу, під час якого зовнішні оцінювання проводяться в криптографічному «боксі», тож моделі не можуть використовувати їх згодом для оптимізації результатів перед тестуванням. Ми співпрацюємо із Сінгапурським інститутом безпеки ШІ, OpenMined, AVERI та MLCommons, щоб протестувати модель Gemini Flash Lite на конфіденційних тестах у середовищі із захистом конфіденційності, підвищуючи цілісність оцінювання.
У Google ми оцінюємо наші системи ШІ за допомогою широкого спектра тестів упродовж розробки та впровадження моделей, але не покладаємося лише на внутрішнє тестування. Щоб виявляти потенційні сліпі зони, ми співпрацюємо з різноманітною групою зовнішніх партнерів, зокрема зі спеціалізованими дослідницькими лабораторіями, представниками громадянського суспільства та національними інститутами безпеки й захисту ШІ (AISI), використовуючи їхній унікальний досвід для стрес-тестування наших моделей.
У міру того як моделі ШІ стають потужнішими, критично важливо гарантувати, що модель не бачила запитань або підказок тесту заздалегідь, адже це може спотворити результати. Політики, дослідники та підприємства мають бути впевнені, що тести ШІ точно відображають справжні можливості й безпеку моделі, але якщо моделі можуть заздалегідь «підглядати» запитання оцінювання, це може штучно завищувати результати й підривати цю довіру.
Хоча протоколи нульового журналювання та суворі договірні гарантії вже давно забезпечують конфіденційність підказок зовнішніх тестів, упровадження технічних і криптографічних засобів захисту є важливим кроком уперед у безпечному оцінюванні моделей.
Як працюють подвійно сліпі оцінювання
Історично зовнішні оцінювання з високими ставками вимагали компромісу. Або оцінювачі передавали свої тестові підказки (ризикуючи, що постачальник моделі побачить запитання тесту заздалегідь), або постачальник моделі передавав ваги своєї моделі (ризикуючи своєю інтелектуальною власністю).
Подвійно сліпі оцінювання усувають цей компроміс. Використовуючи Confidential Space у межах портфоліо Confidential Computing Google Cloud, ми можемо криптографічно підтвердити, що і зовнішні дані оцінювання, і пропрієтарна модель залишаються приватними для їхніх відповідних власників. Оцінювач не може бачити ваги моделі Gemini, а Google не може бачити тестові підказки оцінювача.
Новий підхід до формування довіри до оцінювання моделей
Ці криптографічні докази допомагають запобігати забрудненню тестів і захищати конфіденційні дані. У міру того як моделі стають потужнішими, це набуває особливого значення для високочутливих оцінювань, зокрема тих, що використовуються у сфері кібербезпеки або державними органами. Подвійно сліпі оцінювання відкривають можливість для незалежних організацій ретельно тестувати передові моделі без шкоди для суверенітету даних або безпеки.
Ми сподіваємося, що цей пілотний проєкт започаткує новий етап у нагляді за моделями та допоможе ширшій індустрії створювати безпечніші, надійніші й такі, яким довірятимуть у всьому світі, системи ШІ. Щоб дізнатися більше про нашу методологію та результати, ознайомтеся з нашим технічним звітом.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.