Tutorial Privasi Berbeza: DP‑SGD, DP‑SAM, dan Pengagregatan Selamat Dijelaskan

Blog

Oleh Wendy Frey

86643f6b-1fdd-4e74-866f-9250e22a8ce4-1200x600.webp Privasi Berbeza (DP) telah menjadi blok binaan utama dalam sistem pembelajaran mesin moden di mana perlindungan data pengguna bukanlah pilihan, tetapi keperluan. Bukannya bergantung kepada kepercayaan, DP menyediakan jaminan matematik bahawa setiap titik data individu tidak mempengaruhi model akhir secara signifikan.

Dalam istilah yang lebih mudah, walaupun data satu pengguna dihapus atau diubah, output model seharusnya tetap hampir sama.

Idea ini biasanya diformalkan melalui dua parameter:

  • ε (epsilon), berapa banyak maklumat tentang individu yang boleh bocor (lebih rendah lebih baik)
  • δ (delta), kebarangkalian kecil bahawa jaminan mungkin tidak berlaku dengan sempurna

Cabaran dalam ML dunia nyata bukanlah mendefinisikan DP, tetapi menjadikannya berfungsi dengan cekap tanpa merosakkan prestasi model.

DP-SGD: Kuda Kerja Privasi Berbeza

Kebanyakan sistem DP praktikal dibina di atas DP-SGD (Differentially Private Stochastic Gradient Descent). Ia mengubah SGD standard dalam dua cara utama.

Bagaimana DP-SGD berfungsi

Alih-alih menggunakan gradien mentah dari setiap contoh latihan secara langsung, DP-SGD menerapkan:

  1. Pemotongan gradien, membatasi pengaruh mana-mana sampel tunggal
  2. Penyuntikan bunyi, menambah bunyi Gaussian untuk menyembunyikan sumbangan individu

Gabungan ini memastikan bahawa tidak ada titik data tunggal yang dapat mendominasi proses pembelajaran.

Parameter utama dalam DP-SGD

ParameterApa yang ia kawalMengapa ia penting
Norm pemotonganSaiz gradien maksimum per-sampelMengelakkan outlier daripada mendominasi kemas kini
Pengganda bunyiJumlah bunyi Gaussian yang ditambahSecara langsung mempengaruhi pertukaran privasi-kegunaan
Kadar pengambilanPecahan data per langkahMempengaruhi penggunaan belanjawan privasi
EpochsBilangan pusingan latihanLebih banyak epoch = lebih banyak kos privasi

Nota praktikal yang penting: epsilon bukan sesuatu yang anda "pilih berdasarkan intuisi". Ia dikira menggunakan akauntan privasi, yang mengesan kerugian privasi kumulatif sepanjang latihan.

Pengagregatan Selamat vs Privasi Berbeza

Kedua-dua konsep ini sering dikacaukan, tetapi mereka menyelesaikan masalah yang berbeza.

Pengagregatan Selamat melindungi data semasa penghantaran, manakala Privasi Berbeza melindungi output model akhir.

CiriPengagregatan SelamatPrivasi Berbeza
Apa yang ia lindungiKemas kini klien dalam transitKebocoran maklumat daripada model
Bila ia dikenakanSemasa komunikasiSetelah latihan
Tujuan utamaMenyembunyikan gradien individuMengehadkan pengaruh mana-mana pengguna
Model ancamanPelayan hanya melihat data terkumpulOutput model mesti tidak bocor maklumat

Dalam sistem pengeluaran, mereka sering digunakan bersama:

Pengagregatan Selamat + DP = privasi hujung-ke-hujung yang lebih kuat

DP-SAM: Meningkatkan Ketepatan Di Bawah Kekangan Privasi

Salah satu kelemahan terbesar DP-SGD adalah penurunan prestasi disebabkan oleh bunyi. Di sinilah DP-SAM (Differentially Private Sharpness-Aware Minimization) masuk.

Idea di sebalik DP-SAM adalah sederhana tetapi kuat:

alih-alih melatih model dalam minima tajam (wilayah sensitif), ia menolak pengoptimuman ke arah minima rata, di mana model lebih stabil.

Ini membantu kerana:

  • bunyi mempunyai kesan yang kurang dalam kawasan rata
  • model lebih baik dalam menggeneralisasi di bawah kekangan DP
  • kehilangan ketepatan berkurang berbanding DP-SGD standard

Pertukaran adalah kos pengkomputeran, kerana latihan gaya SAM memerlukan langkah pengoptimuman tambahan.

Perbandingan: DP-SGD vs DP-SAM

AspekDP-SGDDP-SAM
Jaminan privasiKuatKuat
Tujuan pengoptimumanLatihan standardPengoptimuman minima rata
Ketepatan di bawah DPSelalunya lebih rendahBiasanya lebih tinggi
Kos pengkomputeranLebih rendahLebih tinggi
Kes penggunaan terbaikLatihan DP asasModel DP berkualiti pengeluaran

Alur Kerja Praktikal untuk Latihan DP

Dalam pelaksanaan dunia nyata, melaksanakan DP kurang tentang teori dan lebih tentang penyelarasan dan pemantauan yang teliti.

Alur kerja tipikal kelihatan seperti ini:

  1. Definisikan sasaran privasi (ε, δ)
  2. Latihan model asas dengan DP-SGD
  3. Nilai pertukaran kegunaan vs privasi
  4. Terapkan Pengagregatan Selamat (jika tetapan teragregat)
  5. Eksperimen dengan DP-SAM jika ketepatan tidak mencukupi
  6. Gunakan akauntan privasi untuk pengesahan akhir
  7. Dokumentasikan hasil untuk pematuhan dan kebolehan audit

Kesimpulan Akhir

Privasi Berbeza bukanlah satu teknik tetapi pendekatan reka bentuk sistem.

DP-SGD menyediakan asas, Pengagregatan Selamat mengukuhkan keselamatan infrastruktur, dan DP-SAM membantu memulihkan prestasi apabila bunyi privasi menjadi terlalu mahal.

Dalam praktiknya, kebanyakan sistem dunia nyata bergantung pada gabungan ketiga-tiga elemen ini daripada menggunakan satu kaedah secara terasing.

Templat viral

Terokai templat AI viral kami dan gunakannya pada foto anda.

Terokai templat