Differential Privacy Tutorial: DP‑SGD, DP‑SAM, og Sikker Aggrering Forklaret

Blog

Af Wendy Frey

86643f6b-1fdd-4e74-866f-9250e22a8ce4-1200x600.webp Differential Privacy (DP) er blevet en central byggesten i moderne maskinlæringssystemer, hvor beskyttelse af brugerdata ikke er valgfri, men et krav. I stedet for at stole på tillid, giver DP en matematisk garanti for, at individuelle datapunkter ikke væsentligt påvirker den endelige model.

Med andre ord, selv hvis én brugers data fjernes eller ændres, bør outputtet fra modellen forblive næsten det samme.

Denne idé formaliseres typisk gennem to parametre:

  • ε (epsilon), hvor meget information om en enkelt person kan lække (lavere er bedre)
  • δ (delta), en lille sandsynlighed for, at garantien måske ikke holder perfekt

Udfordringen i virkelige ML er ikke at definere DP, men at få det til at fungere effektivt uden at ødelægge modelpræstationen.

DP-SGD: Arbejdshesten for Differential Privacy

De fleste praktiske DP-systemer er bygget oven på DP-SGD (Differentially Private Stochastic Gradient Descent). Det ændrer standard SGD på to væsentlige måder.

Hvordan DP-SGD fungerer

I stedet for at bruge rå gradients fra hvert træningseksempel, anvender DP-SGD:

  1. Gradient clipping, begrænser indflydelsen fra et enkelt eksempel
  2. Noice injection, tilføjer Gaussisk støj for at skjule individuelle bidrag

Denne kombination sikrer, at intet enkelt datapunkt kan dominere læringsprocessen.

Nøgleparametre i DP-SGD

ParameterHvad det styrerHvorfor det er vigtigt
Clipping normMaksimal gradientstørrelse pr. eksempelForhindrer outliers i at dominere opdateringer
Noise multiplierMængden af tilføjet Gaussisk støjPåvirker direkte privacy-utility tradeoff
Sampling rateFraktion af data pr. skridtPåvirker forbrug af privacy budget
EpochsAntal træningsgangeFlere epochs = højere privacy omkostning

En vigtig praktisk note: epsilon er ikke noget, du "vælger efter intuition". Det beregnes ved hjælp af en privacy accountant, der sporer kumulativ privacy tab over træningen.

Sikker Aggrering vs Differential Privacy

Disse to koncepter forveksles ofte, men de løser forskellige problemer.

Sikker Aggrering beskytter data under transmission, mens Differential Privacy beskytter den endelige modeloutput.

FunktionSikker AggreringDifferential Privacy
Hvad det beskytterKlientopdateringer under transportInformation lækage fra modellen
Hvornår det gælderUnder kommunikationEfter træning
HovedmålSkjule individuelle gradientsBegrænse indflydelsen fra enhver bruger
TrusselmodelServeren ser kun aggregerede dataModeloutput må ikke lække info

I produktionssystemer bruges de ofte sammen:

Sikker Aggrering + DP = stærkere end-to-end privacy

DP-SAM: Forbedring af Præcision Under Privacy Begrænsninger

En af de største ulemper ved DP-SGD er præstationsforringelse på grund af støj. Her kommer DP-SAM (Differentially Private Sharpness-Aware Minimization) ind.

Ideen bag DP-SAM er simpel, men kraftfuld:

I stedet for at træne modellen i skarpe minima (sensitive områder), skubber den optimering mod flade minima, hvor modellen er mere stabil.

Dette hjælper fordi:

  • støj har mindre indflydelse i flade områder
  • modellen generaliserer bedre under DP begrænsninger
  • præcisionstab er reduceret sammenlignet med standard DP-SGD

Tradeoffet er beregningsomkostninger, da SAM-stil træning kræver yderligere optimeringsskridt.

Sammenligning: DP-SGD vs DP-SAM

AspektDP-SGDDP-SAM
Privacy garantiStærkStærk
OptimeringsmålStandard træningFlad minima optimering
Præcision under DPOfte lavereNormalt højere
BeregningsomkostningerLavereHøjere
Bedste anvendelsestilfældeBaseline DP træningProduktionskvalitets DP modeller

Praktisk Arbejdsgang for DP Træning

I virkelige implementeringer handler det at implementere DP mindre om teori og mere om omhyggelig tuning og overvågning.

En typisk arbejdsgang ser således ud:

  1. Definere privacy mål (ε, δ)
  2. Træne baseline model med DP-SGD
  3. Vurdere utility vs privacy tradeoff
  4. Anvende Sikker Aggrering (hvis fødereret opsætning)
  5. Eksperimentere med DP-SAM, hvis præcisionen er utilstrækkelig
  6. Bruge privacy accountant til endelig validering
  7. Dokumentere resultater til overholdelse og revisionsmuligheder

Afsluttende Konklusion

Differential Privacy er ikke en enkelt teknik, men en systemdesign tilgang.

DP-SGD giver fundamentet, Sikker Aggrering styrker infrastruktursikkerheden, og DP-SAM hjælper med at genoprette præstationen, når privacystøj bliver for dyrt.

I praksis stoler de fleste virkelige systemer på en kombination af alle tre i stedet for en enkelt metode isoleret.

Virale skabeloner

Udforsk vores virale AI-skabeloner, og brug dem på dine fotos.

Udforsk skabeloner