Google Research пренася федеративното обучение в TEE: Gboard вече се обучава с външно проверима диференциална поверителност
Google Research обяви федеративна система за обучение от следващо поколение, изградена върху федеративно обучение (FL) и доверени среди за изпълнение (TEE). Изследователският екип твърди, че за първи път предоставя гаранции за централна диференциална поверителност (DP) при FL, които могат да бъдат проверени независимо.
Какъв проблем решава федеративното обучение, базирано на TEE?
Google представи федеративното обучение (FL) през 2017 г. То се използва за предсказване на следващата дума и Smart Compose в Gboard, предложения за отговори в Google Messages и Smart Text Selection в Android.
По-ранните системи имаха дефицит на доверие. Устройствата качваха данни за незабавно агрегиране, но външни лица не можеха да проверят дали данните никога не са били записвани или преглеждани. Сигурното агрегиране добави криптографска защита. То обаче не беше съвместимо със съвременни алгоритми за централна DP, като матричната факторизация DP-FTRL. Google също трябваше да му бъде доверено да добавя DP шум коректно.
Новият дизайн премества изчисляването на градиентите от клиентите към сървъра. След това логиката на сървъра подлежи на атестация, така че операторът вече не е необходимо да бъде доверен.
Как работи системата?
Системата се основава на по-ранната работа на Google върху поверителната федеративна аналитика. Тя координира 4 основни компонента:
- Качване на данни: Устройствата криптират локално примерите за обучение и предварително разрешават политика за достъп. Политиката посочва кои изчисления в TEE могат да обработват данните. Политиките трябва да се появяват в публичен журнал за прозрачност.
- KMS и проверка на политиките: Система за управление на ключове, изградена от TEE, работещи с протокола за консенсус RAFT, предоставя ключове само на работни натоварвания, съответстващи на политиката.
- Изпълнение на работното натоварване: Кореневата TEE изпълнява цикъл за обучение на Python и делегира подзадачи на работни TEE. Оркестрацията използва Federated Language, произлязъл от TensorFlow Federated. Освобождават се само DP теглата на модела.
- Отказоустойчиво възстановяване: Всеки рунд запазва състояние за възстановяване, криптирано от KMS, за справяне с повреди на кореневи или работни компоненти.
Защо гаранцията за поверителност може да бъде проверена?
Политиките за достъп се публикуват в Rekor, публичния журнал за прозрачност на Sigstore. Външните одитори могат да проследят всяко сървърно работно натоварване, към което дадено устройство би могло да подаде данни. KMS и двоичните файлове за обработка на данни могат да бъдат възпроизведимо изградени от код с отворен изходен код.
Политиките директно описват програмата за обучение на Python. За да защитят собствените архитектури на моделите, TEE поддържат зареждане на сериализирана логика по време на изпълнение. Цялата логика, свързана с поверителността, трябва да остане твърдо кодирана в атестираната програма. Операторите на работните натоварвания виждат само показатели и DP тегла на модела. Криптираните данни могат да бъдат декриптирани само за ограничено време след качването.
Какво спечели Gboard?
Gboard използва системата, за да пусне модели за предсказване на следващата дума на английски и японски език с по-силни гаранции за поверителност и подобрена точност. Две проектни решения са в основата на това:
- Първо, всички качвания се събират, преди да започне обучението от страна на сървъра. Денонощните колебания в наличността на устройствата вече не забавят обучението. Програмата може да изчисли оптимален график за участие и да настрои DP параметрите. Кривите на Google за съотношението между поверителност и полезност са получени чрез обучение на английски модел в продължение на 5000 рунда с кохорти от 6500 устройства и при двете системи.
- Второ, тясното място беше преместено към сървъра. Предишните FL модели отнемаха от 1 до 2 месеца за обучение всеки. Сега обучението се паралелизира между машините и е ограничено единствено от наличността на ресурсите на TEE. Google съобщава за значително по-бързи изчисления, но не публикува единна стойност за ускорението.
Интерактивно обяснение: Вътрешен поглед към базирания на TEE FL процес
Как работи федеративното обучение, базирано на TEE, на Google
Интерактивно обяснение, базирано на публикацията и научната статия на Google Research от 2 октомври 2026 г. (arXiv:2609.31494).
Изберете сървърното работно натоварване, което иска от KMS ключове за декриптиране. Само кодът, посочен в публикуваната политика за достъп, ги получава.
hash = съответства на политиката в журнала Rekorhash = не е в политиката за достъпПреведено автоматично от английски. Оригиналната статия е на връзката по-долу.