Differential Privacy Tutorial: DP‑SGD, DP‑SAM, och Säker Aggregation Förklarat
Av Wendy Frey
Differential Privacy (DP) har blivit en kärnkomponent i moderna maskininlärningssystem där skydd av användardata inte är valfritt, utan ett krav. Istället för att förlita sig på förtroende, erbjuder DP en matematisk garanti att individuella datapunkter inte betydligt påverkar den slutliga modellen.
Enklare uttryckt, även om en användares data tas bort eller ändras, bör modellens utdata förbli nästan densamma.
Denna idé formaliseras vanligtvis genom två parametrar:
- ε (epsilon), hur mycket information om en individ kan läcka (lägre är bättre)
- δ (delta), en liten sannolikhet att garantin kanske inte håller perfekt
Utmaningen i verklig ML är inte att definiera DP, utan att få det att fungera effektivt utan att förstöra modellens prestanda.
DP-SGD: Arbetshästen för Differential Privacy
De flesta praktiska DP-system bygger på DP-SGD (Differentially Private Stochastic Gradient Descent). Det modifierar standard SGD på två nyckelsätt.
Hur DP-SGD fungerar
Istället för att direkt använda råa grader från varje träningsexempel, tillämpar DP-SGD:
- Gradientklippning, begränsar påverkan av varje enskilt exempel
- Brusinsprutning, lägger till gaussiskt brus för att dölja individuella bidrag
Denna kombination säkerställer att ingen enskild datapunkt kan dominera lärandeprocessen.
Nyckelparametrar i DP-SGD
| Parameter | Vad den kontrollerar | Varför den är viktig |
|---|---|---|
| Klippnorm | Maximal gradientstorlek per prov | Förhindrar att avvikande data dominerar uppdateringar |
| Brusmultiplikator | Mängden gaussiskt brus som läggs till | Påverkar direkt avvägningen mellan integritet och nytta |
| Urvalsgrad | Fraktion av data per steg | Påverkar konsumtion av integritetsbudgeten |
| Epoker | Antal träningspass | Fler epoker = högre integritetskostnad |
En viktig praktisk notering: epsilon är inte något du "väljer intuitivt". Det beräknas med hjälp av en integritetsrevisor, som spårar den kumulativa integritetsförlusten över träningen.
Säker Aggregation vs Differential Privacy
Dessa två koncept förväxlas ofta, men de löser olika problem.
Säker Aggregation skyddar data under överföring, medan Differential Privacy skyddar den slutliga modellens utdata.
| Funktion | Säker Aggregation | Differential Privacy |
|---|---|---|
| Vad den skyddar | Klientuppdateringar under transport | Informationsläckage från modellen |
| När den tillämpas | Under kommunikation | Efter träning |
| Huvudmål | Dölja individuella grader | Begränsa påverkan från någon användare |
| Hotmodell | Servern ser endast aggregerade data | Modellens utdata får inte läcka information |
I produktionssystem används de ofta tillsammans:
Säker Aggregation + DP = starkare slut-till-slut integritet
DP-SAM: Förbättra noggrannhet under integritetsbegränsningar
En av de största nackdelarna med DP-SGD är prestandaförsämring på grund av brus. Här kommer DP-SAM (Differentially Private Sharpness-Aware Minimization) in.
Idén bakom DP-SAM är enkel men kraftfull: instead för att träna modellen i skarpa minima (känsliga områden), trycker den optimeringen mot platta minima, där modellen är mer stabil.
Detta hjälper eftersom:
- brus har mindre påverkan i platta områden
- modellen generaliserar bättre under DP-begränsningar
- noggrannhetsförlusten minskas jämfört med standard DP-SGD
Avvägningen är den beräkningsmässiga kostnaden, eftersom SAM-stilens träning kräver ytterligare optimeringssteg.
Jämförelse: DP-SGD vs DP-SAM
| Aspekt | DP-SGD | DP-SAM |
|---|---|---|
| Integritetsgaranti | Stark | Stark |
| Optimeringsmål | Standardträning | Platt minima optimering |
| Noggrannhet under DP | Ofta lägre | Vanligtvis högre |
| Beräkningskostnad | Lägre | Högre |
| Bästa användningsfall | Baslinje DP-träning | Produktionskvalitets DP-modeller |
Praktiskt arbetsflöde för DP-träning
I verkliga implementeringar handlar det om att implementera DP mindre om teori och mer om noggrant finjustering och övervakning.
Ett typiskt arbetsflöde ser ut så här:
- Definiera integritetsmål (ε, δ)
- Träna baslinjemodellen med DP-SGD
- Utvärdera nyttovärde kontra integritetsavvägning
- Tillämpa Säker Aggregation (om federerad setup)
- Experimentera med DP-SAM om noggrannhet är otillräcklig
- Använd integritetsrevisorn för slutgiltig validering
- Dokumentera resultat för regelefterlevnad och revisionsbarhet
Slutlig Sammanfattning
Differential Privacy är inte en enskild teknik utan ett systemdesignsapproach.
DP-SGD ger grunden, Säker Aggregation stärker infrastruktursäkerheten, och DP-SAM hjälper till att återvinna prestanda när integritetsbruset blir för kostsamt.
I praktiken förlitar sig de flesta verkliga system på en kombination av alla tre snarare än en enskild metod isolerat.




