Differencialinė privatumas: DP‑SGD, DP‑SAM ir saugi agregacija paaiškinta

Blog

Autorius: Wendy Frey

86643f6b-1fdd-4e74-866f-9250e22a8ce4-1200x600.webp Diferencialinė privatumas (DP) tapo pagrindine sudedamąja dalimi šiuolaikinėse mašininio mokymosi sistemose, kur vartotojų duomenų apsauga nėra pasirinkimo galimybė, o reikalavimas. Vietoj to, kad remtųsi pasitikėjimu, DP suteikia matematinę garantiją, kad atskiri duomenų taškai neturi reikšmingos įtakos galutiniam modeliui.

Paprasčiau tariant, net jei vieno vartotojo duomenys bus pašalinti arba pakeisti, modelio išvestis turėtų likti beveik tokia pati.

Ši idėja paprastai formalizuojama per du parametrus:

  • ε (epsilon), kiek informacijos apie atskirą asmenį gali nutekėti (mažesnis yra geriau)
  • δ (delta), nedidelė tikimybė, kad garantija gali nevisiškai veikti

Realiame ML iššūkis nėra DP apibrėžimas, o efektyvus jo veikimas, nesugadinant modelio našumo.

DP-SGD: Diferencialinės privatumo darbo arklys

Dauguma praktinių DP sistemų yra sukurtos remiantis DP-SGD (Diferencialinė privatumo stochastinis gradientų nusileidimas). Jis modifikuoja standartinį SGD dviem pagrindiniais būdais.

Kaip veikia DP-SGD

Vietoj to, kad tiesiogiai naudotų žalius gradientus iš kiekvieno mokymo pavyzdžio, DP-SGD taiko:

  1. Gradientų klipavimas, riboja bet kurio atskiro mėginio įtaką
  2. Triukšmo injekcija, prideda gauso triukšmą, kad paslėptų atskirų indėlių poveikį

Ši kombinacija užtikrina, kad nė vienas atskiras duomenų taškas negalėtų dominuoti mokymosi procese.

Pagrindiniai parametrai DP-SGD

ParametrasKą jis kontroliuojaKodėl tai svarbu
Klipavimo normaMaksimalus gradientų dydis per mėginįNeleidžia užsienyje dominuoti atnaujinimams
Triukšmo daugininkasPridedamo gauso triukšmo kiekisTiesiogiai veikia privatumo naudingumo santykį
Pavyzdžių kiekisDuomenų dalis per žingsnįVeikia privatumo biudžeto suvartojimą
Epochų skaičiusMokymo pereisų skaičiusDaugiau epochų = didesnė privatumo kaina

Vienas svarbus praktinis pastebėjimas: epsilon nėra kažkas, ką pasirinkate „intuicija“. Jis skaičiuojamas naudojant privatumo apskaitininką, kuris seka kumuliatyvų privatumo nuostolį mokymo proceso metu.

Saugaus agregavimo vs diferencinė privatumas

Šios dvi sąvokos dažnai painiojamos, tačiau jos išsprendžia skirtingas problemas.

Saugus agregavimas apsaugo duomenis perduodant, tuo tarpu diferencinė privatumas apsaugo galutinę modelio išvestį.

BruožasSaugus agregavimasDiferencialinė privatumas
Ką jis saugoKlientų atnaujinimus perdavimo metuInformacijos nutekėjimą iš modelio
Kada jis taikomasKomunikacijos metuPo mokymo
Pagrindinis tikslasPaslėpti atskirus gradientusApriboti bet kurio vartotojo poveikį
Grėsmės modelisServeris mato tik agreguotus duomenisModelio išvestis neturi nutekėti informacijos

Gamybos sistemose jie dažnai naudojami kartu:

Saugus agregavimas + DP = stipresnis privatumo užtikrinimas

DP-SAM: Tikslumo gerinimas laikantis privatumo apribojimų

Vienas didžiausių DP-SGD trūkumų yra našumo sumažėjimas dėl triukšmo. Čia pasirodo DP-SAM (Diferencialiai privatus jautrumo sąmoningas minimizavimas).

DP-SAM idėja paprasta, bet galinga: vietoj to, kad mokytų modelį aštriuose minimumuose (jautriuose regionuose), jis stumia optimizavimą link lyginių minimumų, kur modelis yra stabilesnis.

Tai yra naudinga, nes:

  • triukšmas lyginiuose regionuose turi mažesnį poveikį
  • modelis geriau generalizuojasi laikantis DP apribojimų
  • tikslumo praradimas sumažinamas, palyginti su standartiniu DP-SGD

Atsvara yra skaičiavimo kaina, nes SAM tipo mokymas reikalauja papildomų optimizavimo žingsnių.

Palyginimas: DP-SGD vs DP-SAM

AspektasDP-SGDDP-SAM
Privatumo garantijaStipriStipri
Optimizavimo tikslasStandartinis mokymasLyginių minimumų optimizavimas
Tikslumas laikantis DPDažnai mažesnisPaprastai didesnis
Skaičiavimo kainaMažesnėDidesnė
Geriausias naudojimo atvejisBazinis DP mokymasGamybos kokybės DP modeliai

Praktinis DP mokymo procesas

Realiuose diegimuose DP įgyvendinimas yra labiau susijęs su teorija ir daugiau su atidžiu derinimu bei stebėjimu.

Tipiškas darbo srautas atrodo taip:

  1. Apibrėžti privatumo tikslą (ε, δ)
  2. Mokyti bazinį modelį su DP-SGD
  3. Įvertinti naudingumo ir privatumo santykį
  4. Taikyti saugų agregavimą (jei federuota nustatymas)
  5. Eksperimentuoti su DP-SAM, jei tikslumas yra nepakankamas
  6. Naudoti privatumo apskaitininką galutinei validacijai
  7. Dokumentuoti rezultatus, kad atitiktų ir auditorijos reikalavimus

Galutinė išvada

Diferencialinė privatumas nėra viena technika, o sistemos projektavimo požiūris.

DP-SGD užtikrina pagrindą, saugus agregavimas stiprina infrastruktūros saugumą, o DP-SAM padeda atkurti našumą, kai privatumo triukšmas tampa per brangus.

Praktikoje dauguma realių sistemų remiasi visų trijų deriniu, o ne viena atskira metoda.

Virusiniai šablonai

Naršykite mūsų virusinius AI šablonus ir pritaikykite juos savo nuotraukoms.

Naršyti šablonus