Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Пилотирование первых в мире двойных слепых оценок ИИ

27 августа 2026 года Ответственность и безопасность
Пилотирование первых в мире двойных слепых оценок ИИ

Уильям Айзек, Сол Мессинг и Кристиан Лум

Формирование доверия к закрытым бенчмаркам моделей с помощью криптографически защищённых сред

Представьте, что студенту предстоит важный экзамен. Если он случайно подсмотрит вопросы заранее, его идеальный результат будет обусловлен этим знанием, а достижение потеряет смысл. Чтобы по-настоящему измерить его знания, он не должен видеть вопросы до начала экзамена. Именно с такой проблемой сталкивается индустрия при оценке передовых моделей ИИ. Если модель уже видела вопросы теста — проблема, известная как загрязнение бенчмарка, — результатам можно доверять лишь до определённой степени.

Сегодня мы представляем первую в мире двойную слепую оценку закрытой передовой модели ИИ, которая помещает внешние оценки в криптографическую «коробку», не позволяя моделям впоследствии использовать их для оптимизации результатов перед тестированием. Мы сотрудничаем с Сингапурским институтом безопасности ИИ, OpenMined, AVERI и MLCommons, чтобы протестировать модель Gemini Flash Lite на конфиденциальных бенчмарках в среде, обеспечивающей конфиденциальность, повысив целостность оценки.

В Google мы оцениваем наши системы ИИ с помощью широкого спектра проверок на протяжении разработки и внедрения моделей, но не полагаемся исключительно на внутреннее тестирование. Чтобы выявлять потенциальные пробелы, мы работаем с разнообразной группой внешних партнёров, включая специализированные исследовательские лаборатории, организации гражданского общества и национальные институты безопасности и защищённости ИИ (AISI), используя их уникальную экспертизу для стресс-тестирования наших моделей.

По мере того как модели ИИ становятся всё более способными, критически важно убедиться, что модель не видела вопросы или подсказки теста заранее, поскольку это может исказить результаты. Политикам, исследователям и предприятиям необходимо доверять тому, что бенчмарки ИИ точно отражают реальные возможности и безопасность модели, однако если модели могут заранее «подсмотреть» вопросы оценки, это способно искусственно завысить баллы и подорвать такое доверие.

Хотя протоколы нулевого журналирования и строгие договорные гарантии уже давно обеспечивают конфиденциальность подсказок внешних тестов, внедрение технических и криптографических мер защиты знаменует собой значительный шаг вперёд в области безопасной оценки моделей.

Как работают двойные слепые оценки

Архитектурная схема, иллюстрирующая состоящий из 7 шагов защищённый процесс оценки между «Владельцем ИИ» и «Оценщиком» с использованием защищённого «GPU-анклава».Архитектурная схема, иллюстрирующая состоящий из 7 шагов защищённый процесс оценки между «Владельцем ИИ» и «Оценщиком» с использованием защищённого «GPU-анклава».

Исторически внешние оценки высокой значимости требовали компромисса. Либо оценщики передавали свои тестовые подсказки, рискуя тем, что поставщик модели заранее увидит вопросы теста, либо поставщик модели передавал веса своей модели, рискуя интеллектуальной собственностью.

Двойные слепые оценки устраняют этот компромисс. Используя Confidential Space в составе портфеля Confidential Computing Google Cloud, мы можем с помощью криптографии подтвердить, что и данные внешней оценки, и закрытая модель остаются конфиденциальными для своих владельцев. Оценщик не может видеть веса модели Gemini, а Google не может видеть тестовые подсказки оценщика.

Новый подход к формированию доверия к оценкам моделей

Эти криптографические доказательства помогают предотвращать загрязнение бенчмарков и защищать конфиденциальные данные. По мере того как модели становятся всё более способными, это приобретает особое значение для оценок, связанных с особо чувствительными темами, например используемых в сфере кибербезопасности или государственными органами. Двойные слепые оценки позволяют независимым организациям тщательно тестировать передовые модели без ущерба для суверенитета данных или безопасности.

Мы надеемся, что этот пилотный проект откроет новый этап в надзоре за моделями и поможет всей отрасли создавать более безопасные, надёжные и пользующиеся широким доверием системы ИИ. Чтобы узнать больше о нашей методологии и результатах, ознакомьтесь с нашим техническим отчётом.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием DeepMind

Читать оригинал на DeepMind ↗

Текст и изображения принадлежат DeepMind и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости