Differentiële Privacy Tutorial: DP-SGD, DP-SAM en Veilige Aggregatie Uitleg
Door Wendy Frey
Differentiële Privacy (DP) is een kernonderdeel geworden in moderne machine learning systemen waar gebruikersgegevensbescherming geen optie is, maar een vereiste. In plaats van op vertrouwen te bouwen, biedt DP een wiskundige garantie dat individuele gegevenspunten de uiteindelijke modeluitkomst niet significant beïnvloeden.
In eenvoudigere termen, zelfs als de gegevens van één gebruiker worden verwijderd of gewijzigd, zou de output van het model vrijwel hetzelfde moeten blijven.
Dit idee wordt meestal geformaliseerd door twee parameters:
- ε (epsilon), hoeveel informatie over een individu kan uitlekken (lager is beter)
- δ (delta), een kleine kans dat de garantie mogelijk niet perfect is
De uitdaging in de echte wereld van ML is niet het definiëren van DP, maar het efficiënt laten werken zonder de modelprestaties te vernietigen.
DP-SGD: Het Werkpaard van Differentiële Privacy
De meeste praktische DP-systemen zijn gebouwd op DP-SGD (Differentially Private Stochastic Gradient Descent). Het past standaard SGD op twee belangrijke manieren aan.
Hoe DP-SGD werkt
In plaats van direct gebruik te maken van ruwe gradaties van elk trainingsvoorbeeld, past DP-SGD toe:
- Gradient clipping, beperkt de invloed van elke enkele sample
- Noise injection, voegt Gaussische ruis toe om individuele bijdragen te verbergen
Deze combinatie zorgt ervoor dat geen enkel gegevenspunt het leerproces kan domineren.
Belangrijke parameters in DP-SGD
| Parameter | Wat het regelt | Waarom het belangrijk is |
|---|---|---|
| Clipping norm | Maximale gradientgrootte per sample | Voorkomt dat uitschieters updates domineren |
| Noise multiplier | Hoeveel Gaussische ruis wordt toegevoegd | Beïnvloedt direct de privacy-utility trade-off |
| Sampling rate | Fractie van gegevens per stap | Beïnvloedt het verbruik van het privacybudget |
| Epochs | Aantal trainingsrondes | Meer epochs = hogere privacykosten |
Een belangrijke praktische opmerking: epsilon is niet iets dat je "uit je intuïtie kiest". Het wordt berekend met behulp van een privacy accountant, die de cumulatieve privacyverlies gedurende de training bijhoudt.
Veilige Aggregatie vs Differentiële Privacy
Deze twee concepten worden vaak verward, maar ze lossen verschillende problemen op.
Veilige Aggregatie beschermt gegevens tijdens transmissie, terwijl Differentiële Privacy de uiteindelijke modeloutput beschermt.
| Kenmerk | Veilige Aggregatie | Differentiële Privacy |
|---|---|---|
| Wat het beschermt | Klantupdates in transit | Informatie-uitlek van het model |
| Wanneer het toepasbaar is | Tijdens communicatie | Na training |
| Hoofddoel | Verberg individuele gradaties | Beperk invloed van elke gebruiker |
| Bedreigingsmodel | Server ziet alleen geaggregeerde gegevens | Modeloutput mag geen info uitlekken |
In productiesystemen worden ze vaak samen gebruikt:
Veilige Aggregatie + DP = sterkere end-to-end privacy
DP-SAM: Verbeteren van Nauwkeurigheid Onder Privacybeperkingen
Een van de grootste nadelen van DP-SGD is prestatieverlies door ruis. Hier komt DP-SAM (Differentially Private Sharpness-Aware Minimization) in beeld.
Het idee achter DP-SAM is eenvoudig maar krachtig:
in plaats van het model te trainen in scherpe minima (gevoelige gebieden), duwt het optimalisatie naar platte minima, waar het model stabieler is.
Dit helpt omdat:
- ruis minder impact heeft in platte gebieden
- het model beter generaliseert onder DP-beperkingen
- nauwkeurigheidsverlies wordt verminderd in vergelijking met standaard DP-SGD
De trade-off is computationele kosten, aangezien SAM-stijl training extra optimalisatie-stappen vereist.
Vergelijking: DP-SGD vs DP-SAM
| Aspect | DP-SGD | DP-SAM |
|---|---|---|
| Privacygarantie | Sterk | Sterk |
| Optimalisatiedoel | Standaard training | Optimalisatie van platte minima |
| Nauwkeurigheid onder DP | Vaak lager | Gewoonlijk hoger |
| Computationele kosten | Lager | Hoger |
| Beste gebruiksgeval | Basis DP training | Productieklare DP-modellen |
Praktische Workflow voor DP Training
In echte implementaties gaat het bij het implementeren van DP minder om theorie en meer om zorgvuldige afstemming en monitoring.
Een typische workflow ziet er als volgt uit:
- Definieer privacydoel (ε, δ)
- Train baseline model met DP-SGD
- Evalueer utility vs privacy trade-off
- Pas Veilige Aggregatie toe (indien gefedereerde opstelling)
- Experimenteer met DP-SAM als nauwkeurigheid onvoldoende is
- Gebruik privacy accountant voor finale validatie
- Documenteer resultaten voor naleving en controleerbaarheid
Laatste Opmerking
Differentiële Privacy is geen enkele techniek, maar een systeemontwerpbenadering.
DP-SGD biedt de basis, Veilige Aggregatie versterkt de infrastructuurbeveiliging, en DP-SAM helpt prestaties te herstellen wanneer privacyruis te duur wordt.
In de praktijk vertrouwen de meeste systemen in de echte wereld op een combinatie van alle drie in plaats van een enkele methode in isolatie.




