844-ai.ro
Înțelege AI. Folosește-l. Construiește viitorul.
Căutare
Flash AI · Cercetare

Google prezintă un sistem de învățare federată cu garanții de confidențialitate verificabile extern

Oficial

Publicat: 6 octombrie 2026

Google Research anunță o nouă generație de sistem pentru învățare federată, construită cu ajutorul unor medii de execuție de încredere, cunoscute drept TEE. Potrivit companiei, obiectivul este ca garanțiile de anonimizare a datelor să poată fi verificate și auditate din exterior, în timp ce o parte importantă a calculului este mutată pe server pentru a accelera antrenarea modelelor, a îmbunătăți acuratețea și a extinde acoperirea dispozitivelor. Anunțul privește o tehnică în care mai multe entități, denumite clienți, colaborează la rezolvarea unei probleme de învățare automată sub coordonarea unui furnizor de servicii, păstrând datele distribuite. Google indică utilizări anterioare ale învățării federate în funcții precum predicția următorului cuvânt și Smart Compose din Gboard, sugestiile de răspuns din Google Messages și selectarea inteligentă a textului în Android.

Compania își plasează dezvoltarea sistemelor de învățare federată sub patru principii: minimizarea datelor, anonimizarea, transparența și controlul, respectiv verificabilitatea și auditabilitatea. Cercetările anterioare au folosit confidențialitatea diferențială și agregarea securizată pentru protejarea procesului de antrenare. Totuși, Google descrie o limită a sistemelor precedente: datele de pe dispozitive erau încărcate pentru agregare imediată, fără ca observatorii externi să poată verifica dacă acestea nu erau înregistrate sau inspectate. Agregarea securizată a oferit ulterior protecție criptografică pentru încărcări, însă, conform articolului, nu era compatibilă cu garanțiile centrale de confidențialitate diferențială considerate de ultimă generație. Noul design este prezentat ca o etapă în direcția reducerii nevoii de a avea încredere în operatorul serverului.

În noua arhitectură, datele de antrenare criptate colectate de la dispozitive pot fi decriptate și procesate numai în TEE-uri care rulează programe Python de antrenare reprezentate în politicile de acces și numai pentru un interval limitat după încărcare. Operatorii sarcinilor de lucru pot vedea doar metrici și ponderi ale modelului protejate prin confidențialitate diferențială. TEE-urile oferă atestare la distanță, astfel încât terți pot verifica logica executată; ele oferă totodată confidențialitate pentru starea internă și integritate pentru logică, în limitele tehnologiei TEE din generația curentă. Aceste proprietăți sunt importante în relatarea Google deoarece permit verificarea codului relevant pentru protecția vieții private, nu doar acceptarea unei promisiuni privind comportamentul serverului.

Transparența este susținută și prin publicarea politicilor de acces într-un jurnal public de transparență, Rekor. Dispozitivele participante pot cunoaște setul complet de sarcini de lucru de pe server care ar putea accesa datele încărcate, iar auditorii externi pot urmări aceste politici pentru a vedea ce sarcini ar putea implica datele dispozitivelor. Politicile descriu direct programul Python care exprimă logica de antrenare. Google precizează că sistemul permite încărcarea la rulare a unor informații serializate pentru a proteja arhitecturi de modele și logică de preprocesare proprietare. Garanțiile puternice verificabile extern sunt condiționate de păstrarea logicii relevante pentru confidențialitate direct în programul Python. De asemenea, componentele pentru gestionarea cheilor și procesarea datelor pot fi construite reproductibil din cod open-source publicat de companie.

Google afirmă că Gboard a adoptat deja sistemul pentru modele de predicție a următorului cuvânt în engleză și japoneză, cu garanții de confidențialitate mai puternice și acuratețe îmbunătățită. Schimbarea operațională centrală este colectarea tuturor încărcărilor de pe dispozitive înainte de rularea antrenării pe server. Astfel, variațiile zilnice ale disponibilității dispozitivelor nu mai afectează în același mod progresul antrenării, iar programul poate calcula la momentul execuției un calendar optim de participare și poate ajusta alți parametri ai confidențialității diferențiale. Google compară această abordare cu sistemele anterioare, în care antrenarea unui astfel de model putea dura una sau două luni și era limitată de disponibilitatea dispozitivelor, calculul local și concurența dintre mai multe sarcini pentru aceleași resurse.

Mutarea calculului gradientelor de la dispozitive către server elimină constrângerile legate de resursele de calcul locale și, potrivit companiei, poate deschide calea către modele mai mari antrenate prin tehnici federate. Viteza rămâne însă limitată în prezent de disponibilitatea resurselor TEE, iar integrarea acestora cu acceleratoare este indicată drept relevantă pentru utilizările viitoare. Infrastructura poate executa și alte sarcini exprimate în Python, iar Google menționează experimente cu generarea de date sintetice și explorarea combinării cu TEE-uri specializate pentru funcții precum inferența modelelor lingvistice mari. Anunțul nu susține că toate riscurile au fost eliminate: compania invocă limitele TEE-urilor actuale, cercetarea în curs privind observațiile prin canale laterale și perspectiva, nu certitudinea actuală, unor demonstrații complete ale corectitudinii implementărilor software pentru algoritmii de confidențialitate diferențială și componentele sistemului.

Sursă primară

https://research.google/blog/toward-provably-private-learning-from-federated-data/ →

Publicată de sursă: 2 octombrie 2026

Comentarii

Se încarcă discuția…

Verificăm sesiunea…

Abonează-te la newsletter

Primești o dată pe săptămână cele mai importante noutăți AI, direct pe email.