Differential Privacy Tutorial: DP‑SGD, DP‑SAM, og Sikker Aggrering Forklaret
Af Wendy Frey
Differential Privacy (DP) er blevet en central byggesten i moderne maskinlæringssystemer, hvor beskyttelse af brugerdata ikke er valgfri, men et krav. I stedet for at stole på tillid, giver DP en matematisk garanti for, at individuelle datapunkter ikke væsentligt påvirker den endelige model.
Med andre ord, selv hvis én brugers data fjernes eller ændres, bør outputtet fra modellen forblive næsten det samme.
Denne idé formaliseres typisk gennem to parametre:
- ε (epsilon), hvor meget information om en enkelt person kan lække (lavere er bedre)
- δ (delta), en lille sandsynlighed for, at garantien måske ikke holder perfekt
Udfordringen i virkelige ML er ikke at definere DP, men at få det til at fungere effektivt uden at ødelægge modelpræstationen.
DP-SGD: Arbejdshesten for Differential Privacy
De fleste praktiske DP-systemer er bygget oven på DP-SGD (Differentially Private Stochastic Gradient Descent). Det ændrer standard SGD på to væsentlige måder.
Hvordan DP-SGD fungerer
I stedet for at bruge rå gradients fra hvert træningseksempel, anvender DP-SGD:
- Gradient clipping, begrænser indflydelsen fra et enkelt eksempel
- Noice injection, tilføjer Gaussisk støj for at skjule individuelle bidrag
Denne kombination sikrer, at intet enkelt datapunkt kan dominere læringsprocessen.
Nøgleparametre i DP-SGD
| Parameter | Hvad det styrer | Hvorfor det er vigtigt |
|---|---|---|
| Clipping norm | Maksimal gradientstørrelse pr. eksempel | Forhindrer outliers i at dominere opdateringer |
| Noise multiplier | Mængden af tilføjet Gaussisk støj | Påvirker direkte privacy-utility tradeoff |
| Sampling rate | Fraktion af data pr. skridt | Påvirker forbrug af privacy budget |
| Epochs | Antal træningsgange | Flere epochs = højere privacy omkostning |
En vigtig praktisk note: epsilon er ikke noget, du "vælger efter intuition". Det beregnes ved hjælp af en privacy accountant, der sporer kumulativ privacy tab over træningen.
Sikker Aggrering vs Differential Privacy
Disse to koncepter forveksles ofte, men de løser forskellige problemer.
Sikker Aggrering beskytter data under transmission, mens Differential Privacy beskytter den endelige modeloutput.
| Funktion | Sikker Aggrering | Differential Privacy |
|---|---|---|
| Hvad det beskytter | Klientopdateringer under transport | Information lækage fra modellen |
| Hvornår det gælder | Under kommunikation | Efter træning |
| Hovedmål | Skjule individuelle gradients | Begrænse indflydelsen fra enhver bruger |
| Trusselmodel | Serveren ser kun aggregerede data | Modeloutput må ikke lække info |
I produktionssystemer bruges de ofte sammen:
Sikker Aggrering + DP = stærkere end-to-end privacy
DP-SAM: Forbedring af Præcision Under Privacy Begrænsninger
En af de største ulemper ved DP-SGD er præstationsforringelse på grund af støj. Her kommer DP-SAM (Differentially Private Sharpness-Aware Minimization) ind.
Ideen bag DP-SAM er simpel, men kraftfuld:
I stedet for at træne modellen i skarpe minima (sensitive områder), skubber den optimering mod flade minima, hvor modellen er mere stabil.
Dette hjælper fordi:
- støj har mindre indflydelse i flade områder
- modellen generaliserer bedre under DP begrænsninger
- præcisionstab er reduceret sammenlignet med standard DP-SGD
Tradeoffet er beregningsomkostninger, da SAM-stil træning kræver yderligere optimeringsskridt.
Sammenligning: DP-SGD vs DP-SAM
| Aspekt | DP-SGD | DP-SAM |
|---|---|---|
| Privacy garanti | Stærk | Stærk |
| Optimeringsmål | Standard træning | Flad minima optimering |
| Præcision under DP | Ofte lavere | Normalt højere |
| Beregningsomkostninger | Lavere | Højere |
| Bedste anvendelsestilfælde | Baseline DP træning | Produktionskvalitets DP modeller |
Praktisk Arbejdsgang for DP Træning
I virkelige implementeringer handler det at implementere DP mindre om teori og mere om omhyggelig tuning og overvågning.
En typisk arbejdsgang ser således ud:
- Definere privacy mål (ε, δ)
- Træne baseline model med DP-SGD
- Vurdere utility vs privacy tradeoff
- Anvende Sikker Aggrering (hvis fødereret opsætning)
- Eksperimentere med DP-SAM, hvis præcisionen er utilstrækkelig
- Bruge privacy accountant til endelig validering
- Dokumentere resultater til overholdelse og revisionsmuligheder
Afsluttende Konklusion
Differential Privacy er ikke en enkelt teknik, men en systemdesign tilgang.
DP-SGD giver fundamentet, Sikker Aggrering styrker infrastruktursikkerheden, og DP-SAM hjælper med at genoprette præstationen, når privacystøj bliver for dyrt.
I praksis stoler de fleste virkelige systemer på en kombination af alle tre i stedet for en enkelt metode isoleret.




