Differential Privacy Tutorial: DP‑SGD, DP‑SAM, och Säker Aggregation Förklarat

Blog

Av Wendy Frey

86643f6b-1fdd-4e74-866f-9250e22a8ce4-1200x600.webp Differential Privacy (DP) har blivit en kärnkomponent i moderna maskininlärningssystem där skydd av användardata inte är valfritt, utan ett krav. Istället för att förlita sig på förtroende, erbjuder DP en matematisk garanti att individuella datapunkter inte betydligt påverkar den slutliga modellen.

Enklare uttryckt, även om en användares data tas bort eller ändras, bör modellens utdata förbli nästan densamma.

Denna idé formaliseras vanligtvis genom två parametrar:

  • ε (epsilon), hur mycket information om en individ kan läcka (lägre är bättre)
  • δ (delta), en liten sannolikhet att garantin kanske inte håller perfekt

Utmaningen i verklig ML är inte att definiera DP, utan att få det att fungera effektivt utan att förstöra modellens prestanda.

DP-SGD: Arbetshästen för Differential Privacy

De flesta praktiska DP-system bygger på DP-SGD (Differentially Private Stochastic Gradient Descent). Det modifierar standard SGD på två nyckelsätt.

Hur DP-SGD fungerar

Istället för att direkt använda råa grader från varje träningsexempel, tillämpar DP-SGD:

  1. Gradientklippning, begränsar påverkan av varje enskilt exempel
  2. Brusinsprutning, lägger till gaussiskt brus för att dölja individuella bidrag

Denna kombination säkerställer att ingen enskild datapunkt kan dominera lärandeprocessen.

Nyckelparametrar i DP-SGD

ParameterVad den kontrollerarVarför den är viktig
KlippnormMaximal gradientstorlek per provFörhindrar att avvikande data dominerar uppdateringar
BrusmultiplikatorMängden gaussiskt brus som läggs tillPåverkar direkt avvägningen mellan integritet och nytta
UrvalsgradFraktion av data per stegPåverkar konsumtion av integritetsbudgeten
EpokerAntal träningspassFler epoker = högre integritetskostnad

En viktig praktisk notering: epsilon är inte något du "väljer intuitivt". Det beräknas med hjälp av en integritetsrevisor, som spårar den kumulativa integritetsförlusten över träningen.

Säker Aggregation vs Differential Privacy

Dessa två koncept förväxlas ofta, men de löser olika problem.

Säker Aggregation skyddar data under överföring, medan Differential Privacy skyddar den slutliga modellens utdata.

FunktionSäker AggregationDifferential Privacy
Vad den skyddarKlientuppdateringar under transportInformationsläckage från modellen
När den tillämpasUnder kommunikationEfter träning
HuvudmålDölja individuella graderBegränsa påverkan från någon användare
HotmodellServern ser endast aggregerade dataModellens utdata får inte läcka information

I produktionssystem används de ofta tillsammans:

Säker Aggregation + DP = starkare slut-till-slut integritet

DP-SAM: Förbättra noggrannhet under integritetsbegränsningar

En av de största nackdelarna med DP-SGD är prestandaförsämring på grund av brus. Här kommer DP-SAM (Differentially Private Sharpness-Aware Minimization) in.

Idén bakom DP-SAM är enkel men kraftfull: instead för att träna modellen i skarpa minima (känsliga områden), trycker den optimeringen mot platta minima, där modellen är mer stabil.

Detta hjälper eftersom:

  • brus har mindre påverkan i platta områden
  • modellen generaliserar bättre under DP-begränsningar
  • noggrannhetsförlusten minskas jämfört med standard DP-SGD

Avvägningen är den beräkningsmässiga kostnaden, eftersom SAM-stilens träning kräver ytterligare optimeringssteg.

Jämförelse: DP-SGD vs DP-SAM

AspektDP-SGDDP-SAM
IntegritetsgarantiStarkStark
OptimeringsmålStandardträningPlatt minima optimering
Noggrannhet under DPOfta lägreVanligtvis högre
BeräkningskostnadLägreHögre
Bästa användningsfallBaslinje DP-träningProduktionskvalitets DP-modeller

Praktiskt arbetsflöde för DP-träning

I verkliga implementeringar handlar det om att implementera DP mindre om teori och mer om noggrant finjustering och övervakning.

Ett typiskt arbetsflöde ser ut så här:

  1. Definiera integritetsmål (ε, δ)
  2. Träna baslinjemodellen med DP-SGD
  3. Utvärdera nyttovärde kontra integritetsavvägning
  4. Tillämpa Säker Aggregation (om federerad setup)
  5. Experimentera med DP-SAM om noggrannhet är otillräcklig
  6. Använd integritetsrevisorn för slutgiltig validering
  7. Dokumentera resultat för regelefterlevnad och revisionsbarhet

Slutlig Sammanfattning

Differential Privacy är inte en enskild teknik utan ett systemdesignsapproach.

DP-SGD ger grunden, Säker Aggregation stärker infrastruktursäkerheten, och DP-SAM hjälper till att återvinna prestanda när integritetsbruset blir för kostsamt.

I praktiken förlitar sig de flesta verkliga system på en kombination av alla tre snarare än en enskild metod isolerat.

Virala mallar

Utforska våra virala AI-mallar och applicera dem på dina foton.

Utforska mallar