Пилотно провеждане на първите в света двойно слепи оценки на ИИ
Изграждане на доверие в собствените бенчмаркове за модели чрез криптографски защитени среди
Представете си, че ученик предстои да се яви на изпит с високи залози. Ако случайно надникне предварително във въпросите, постигането на отличен резултат ще бъде повлияно от това знание, което ще направи постижението безсмислено. За да измерим действително какво знае, той не трябва да има достъп до въпросите, докато не настъпи моментът за изпита. Това е точното предизвикателство, пред което е изправена индустрията при оценяването на напреднали модели на ИИ. Ако даден модел вече е виждал въпросите от теста — проблем, известен като замърсяване на бенчмарка — резултатите могат да бъдат приети за надеждни само до известна степен.
Днес представяме първата в света двойно сляпа оценка на собствен модел на ИИ от най-висок клас, която ограничава външните оценки до криптографска „кутия“, така че те да не могат да бъдат използвани по-късно от моделите за оптимизиране на представянето преди тестването. Партнираме си със Singapore AI Safety Institute, OpenMined, AVERI и MLCommons, за да тестваме модел Gemini Flash Lite спрямо поверителни бенчмаркове в среда, съхраняваща поверителността, като повишим интегритета на оценяването.
В Google оценяваме нашите системи за ИИ чрез широк спектър от оценки по време на разработването и внедряването на моделите, но не разчитаме само на вътрешно тестване. За да идентифицираме потенциални слепи петна, работим с разнообразна група външни партньори, включително специализирани изследователски лаборатории, организации на гражданското общество и национални институти за безопасност и сигурност на ИИ (AISI), като използваме техния уникален опит, за да подложим моделите си на стрес тестове.
С повишаването на способностите на моделите на ИИ е от решаващо значение да се гарантира, че моделът не е виждал предварително въпросите или подканите от теста, тъй като това може да изкриви резултатите. Политиците, изследователите и предприятията трябва да могат да се доверят, че бенчмарковете за ИИ точно отразяват реалните способности и безопасността на даден модел, но ако моделите могат да „надникнат“ предварително във въпросите от оценяването, това може изкуствено да повиши резултатите и да подкопае това доверие.
Макар протоколите за нулево регистриране и строгите договорни гаранции отдавна да пазят поверителността на външните тестови подканяния, включването на технически и криптографски мерки за защита представлява значителна крачка напред в сигурното оценяване на модели.
Как работят двойно слепите оценки
В исторически план външните оценки с високи залози изискваха компромис. Или оценяващите предаваха своите тестови подканяния, рискувайки доставчикът на модела да види предварително въпросите от теста, или доставчикът на модела предаваше теглата на модела си, рискувайки своята интелектуална собственост.
Двойно слепите оценки премахват този компромис. Чрез използването на Confidential Space в рамките на портфолиото Confidential Computing на Google Cloud можем криптографски да проверим, че както външните данни за оценяване, така и собственият модел остават поверителни за съответните им собственици. Оценяващият не може да види теглата на модела Gemini, а Google не може да види тестовите подканяния на оценяващия.
Нов подход към изграждането на доверие в оценяването на модели
Тези криптографски доказателства помагат да се предотврати замърсяването на бенчмарковете и защитават чувствителните данни. С повишаването на способностите на моделите това става особено важно за високочувствителни оценки, като използваните за киберсигурност или от държавни органи. Двойно слепите оценки дават възможност на независими организации да тестват задълбочено напреднали модели, без да застрашават суверенитета или сигурността на данните.
Надяваме се този пилотен проект да постави нов стандарт за надзора над моделите, като помогне на по-широката индустрия да създава по-безопасни, по-надеждни и широко приемани системи за ИИ. За да научите повече за нашата методология и резултатите, прочетете нашия технически доклад.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.