Differential Privacy -opas: DP-SGD, DP-SAM ja turvallinen aggregaatio selitetty

Blog

Kirjoittaja: Wendy Frey

86643f6b-1fdd-4e74-866f-9250e22a8ce4-1200x600.webp Eroavaisuus Yksityisyys (DP) on tullut keskeiseksi rakennusmateriaaliksi nykyaikaisissa koneoppimisjärjestelmissä, joissa käyttäjätiedon suojaaminen ei ole valinnaista, vaan vaatimus. Sen sijaan, että luotettaisiin luottamukseen, DP tarjoaa matemaattisen takuun siitä, että yksittäiset tietopisteet eivät merkittävästi vaikuta lopulliseen malliin.

Yksinkertaisemmin sanottuna, vaikka yhden käyttäjän data poistetaan tai muutetaan, mallin tuloksen pitäisi pysyä lähes muuttumattomana.

Tämä idea virallisesti määritellään yleensä kahden parametrin avulla:

  • ε (epsilon), kuinka paljon tietoa yksilöstä voi vuotaa (matalampi on parempi)
  • δ (delta), pieni todennäköisyys siitä, että takuu ei päde täydellisesti

Haaste todellisessa koneoppimisessa ei ole DP:n määrittäminen, vaan sen tehokas toiminta ilman mallin suorituskyvyn pilaamista.

DP-SGD: Eroavaisuus Yksityisyyden Työhevonen

Suurin osa käytännön DP-järjestelmistä perustuu DP-SGD:hen (Eroavaisuus Yksityisyys Stokastinen Gradienttilaskeuma). Se muokkaa tavallista SGD:tä kahdella keskeisellä tavalla.

Kuinka DP-SGD toimii

Sen sijaan, että käytettäisiin suoraan raakagradienteja jokaisesta harjoitusesimerkistä, DP-SGD soveltaa:

  1. Gradientin rajaaminen, rajoittaa yksittäisen näytteen vaikutusta
  2. Melu lisäys, lisää Gaussista melua piilottaakseen yksittäiset panokset

Tämä yhdistelmä varmistaa, että mikään yksittäinen tietopiste ei voi hallita oppimisprosessia.

Keskeiset parametrit DP-SGD:ssä

ParametriMitä se sääteleeMiksi se on tärkeää
RajaamisnormiSuurin gradienttikoko per näyteEstää poikkeamien hallitsemasta päivityksiä
Melu kertoimenLisättävän Gaussin melun määräVaikuttaa suoraan yksityisyyden ja hyödyllisyyden vaihtosuhteeseen
NäytteenottosuhdeOsuus datasta per askelVaikuttaa yksityisyysbudjetin kulutukseen
EpochitHarjoitusjaksojen määräEnemmän epochita = enemmän yksityisyyskustannuksia

Yksi tärkeä käytännön huomio: epsilon ei ole jotain, jonka ”valitset intuitiivisesti”. Se lasketaan käyttämällä yksityisyyskirjanpitäjää, joka seuraa kumulatiivista yksityisyysmenetystä koulutuksen aikana.

Turvallinen aggregaatio vs Eroavaisuus Yksityisyys

Nämä kaksi käsitettä sekoitetaan usein, mutta ne ratkaisevat erilaisia ongelmia.

Turvallinen aggregaatio suojaa dataa siirron aikana, kun taas Eroavaisuus Yksityisyys suojaa lopullista mallin tulosta.

OminaisuusTurvallinen aggregaatioEroavaisuus Yksityisyys
Mitä se suojaaAsiakkaan päivitykset siirrossaTietovuodot mallista
Milloin se päteeKommunikoinnin aikanaKoulutuksen jälkeen
PäämääräPiilottaa yksittäiset gradientitRajoittaa jokaisen käyttäjän vaikutusta
UhkataustaPalvelin näkee vain koottua dataaMallin tuloksen ei saa vuotaa tietoja

Tuotantojärjestelmissä niitä käytetään usein yhdessä:

Turvallinen aggregaatio + DP = vahvempi päätepisteeseen yksityisyys

DP-SAM: Tarkkuuden parantaminen yksityisyysrajoitusten alla

Yksi suurimmista DP-SGD:n haittapuolista on suorituskyvyn heikkeneminen melun vuoksi. Tässä kohtaa DP-SAM (Eroavaisuus Yksityisyys Terävyyttä Tunnistava Minimointi) tulee kuvaan.

DP-SAM:n idea on yksinkertainen mutta voimakas:

Sen sijaan, että koulutettaisiin mallia terävissä minimaissa (herkissä alueissa), se suuntaa optimoinnin kohti tasaisia minimaita, joissa malli on vakaampi.

Tämä auttaa, koska:

  • melu vaikuttaa vähemmän tasaisilla alueilla
  • malli yleistää paremmin DP-rajoitteiden alla
  • tarkkuuden menetys on vähäisempi verrattuna tavanomaiseen DP-SGD:hen

Vaihtosuhteena on laskennallinen kustannus, koska SAM-tyyppinen koulutus vaatii lisäoptimointivaiheita.

Vertailu: DP-SGD vs DP-SAM

NäkökohtaDP-SGDDP-SAM
Yksityisyys takuuVahvaVahva
OptimointitavoiteTavanomainen koulutusTasaiset minima-optimoitu
Tarkkuus DP:n allaUsein alempiYleensä korkeampi
Laskennallinen kustannusAlempiKorkeampi
Paras käyttötapaPerus DP-koulutusTuotantolaadun DP-mallit

Käytännön Työnkulku DP-koulutuksessa

Todellisissa implementaatioissa DP:n toteutaminen ei ole niinkään teoriaa, vaan huolellista hienosäätöä ja seurantaa.

Tyypillinen työnkulku näyttää tältä:

  1. Määrittele yksityisyystavoite (ε, δ)
  2. Kouluta perusmallia DP-SGD:llä
  3. Arvioi hyödyllisyyden vs yksityisyyden vaihtosuhde
  4. Käytä Turvallista aggregaatiota (jos liittoutettu asetus)
  5. Kokeile DP-SAM:a, jos tarkkuus on riittämätön
  6. Käytä yksityisyyskirjanpitäjää lopulliseen validaatioon
  7. Kirjaa tulokset noudattamista ja auditointia varten

Lopullinen Yhteenveto

Eroavaisuus Yksityisyys ei ole yksittäinen tekniikka, vaan järjestelmän suunnittelutapa.

DP-SGD tarjoaa perustan, Turvallinen aggregaatio vahvistaa infrastruktuurin turvallisuutta, ja DP-SAM auttaa palauttamaan suorituskykyä, kun yksityisyysmelu tulee liian kalliiksi.

Käytännössä useimmat todelliset järjestelmät perustuvat kaikkien kolmen yhdistelmään sen sijaan, että käyttäisivät vain yhtä menetelmää eristyksissä.

Viraalit mallit

Tutustu viraaleihin AI-malleihimme ja käytä niitä omissa kuvissasi.

Tutustu malleihin