Tutorial Privasi Berbeza: DP‑SGD, DP‑SAM, dan Pengagregatan Selamat Dijelaskan
Oleh Wendy Frey
Privasi Berbeza (DP) telah menjadi blok binaan utama dalam sistem pembelajaran mesin moden di mana perlindungan data pengguna bukanlah pilihan, tetapi keperluan. Bukannya bergantung kepada kepercayaan, DP menyediakan jaminan matematik bahawa setiap titik data individu tidak mempengaruhi model akhir secara signifikan.
Dalam istilah yang lebih mudah, walaupun data satu pengguna dihapus atau diubah, output model seharusnya tetap hampir sama.
Idea ini biasanya diformalkan melalui dua parameter:
- ε (epsilon), berapa banyak maklumat tentang individu yang boleh bocor (lebih rendah lebih baik)
- δ (delta), kebarangkalian kecil bahawa jaminan mungkin tidak berlaku dengan sempurna
Cabaran dalam ML dunia nyata bukanlah mendefinisikan DP, tetapi menjadikannya berfungsi dengan cekap tanpa merosakkan prestasi model.
DP-SGD: Kuda Kerja Privasi Berbeza
Kebanyakan sistem DP praktikal dibina di atas DP-SGD (Differentially Private Stochastic Gradient Descent). Ia mengubah SGD standard dalam dua cara utama.
Bagaimana DP-SGD berfungsi
Alih-alih menggunakan gradien mentah dari setiap contoh latihan secara langsung, DP-SGD menerapkan:
- Pemotongan gradien, membatasi pengaruh mana-mana sampel tunggal
- Penyuntikan bunyi, menambah bunyi Gaussian untuk menyembunyikan sumbangan individu
Gabungan ini memastikan bahawa tidak ada titik data tunggal yang dapat mendominasi proses pembelajaran.
Parameter utama dalam DP-SGD
| Parameter | Apa yang ia kawal | Mengapa ia penting |
|---|---|---|
| Norm pemotongan | Saiz gradien maksimum per-sampel | Mengelakkan outlier daripada mendominasi kemas kini |
| Pengganda bunyi | Jumlah bunyi Gaussian yang ditambah | Secara langsung mempengaruhi pertukaran privasi-kegunaan |
| Kadar pengambilan | Pecahan data per langkah | Mempengaruhi penggunaan belanjawan privasi |
| Epochs | Bilangan pusingan latihan | Lebih banyak epoch = lebih banyak kos privasi |
Nota praktikal yang penting: epsilon bukan sesuatu yang anda "pilih berdasarkan intuisi". Ia dikira menggunakan akauntan privasi, yang mengesan kerugian privasi kumulatif sepanjang latihan.
Pengagregatan Selamat vs Privasi Berbeza
Kedua-dua konsep ini sering dikacaukan, tetapi mereka menyelesaikan masalah yang berbeza.
Pengagregatan Selamat melindungi data semasa penghantaran, manakala Privasi Berbeza melindungi output model akhir.
| Ciri | Pengagregatan Selamat | Privasi Berbeza |
|---|---|---|
| Apa yang ia lindungi | Kemas kini klien dalam transit | Kebocoran maklumat daripada model |
| Bila ia dikenakan | Semasa komunikasi | Setelah latihan |
| Tujuan utama | Menyembunyikan gradien individu | Mengehadkan pengaruh mana-mana pengguna |
| Model ancaman | Pelayan hanya melihat data terkumpul | Output model mesti tidak bocor maklumat |
Dalam sistem pengeluaran, mereka sering digunakan bersama:
Pengagregatan Selamat + DP = privasi hujung-ke-hujung yang lebih kuat
DP-SAM: Meningkatkan Ketepatan Di Bawah Kekangan Privasi
Salah satu kelemahan terbesar DP-SGD adalah penurunan prestasi disebabkan oleh bunyi. Di sinilah DP-SAM (Differentially Private Sharpness-Aware Minimization) masuk.
Idea di sebalik DP-SAM adalah sederhana tetapi kuat:
alih-alih melatih model dalam minima tajam (wilayah sensitif), ia menolak pengoptimuman ke arah minima rata, di mana model lebih stabil.
Ini membantu kerana:
- bunyi mempunyai kesan yang kurang dalam kawasan rata
- model lebih baik dalam menggeneralisasi di bawah kekangan DP
- kehilangan ketepatan berkurang berbanding DP-SGD standard
Pertukaran adalah kos pengkomputeran, kerana latihan gaya SAM memerlukan langkah pengoptimuman tambahan.
Perbandingan: DP-SGD vs DP-SAM
| Aspek | DP-SGD | DP-SAM |
|---|---|---|
| Jaminan privasi | Kuat | Kuat |
| Tujuan pengoptimuman | Latihan standard | Pengoptimuman minima rata |
| Ketepatan di bawah DP | Selalunya lebih rendah | Biasanya lebih tinggi |
| Kos pengkomputeran | Lebih rendah | Lebih tinggi |
| Kes penggunaan terbaik | Latihan DP asas | Model DP berkualiti pengeluaran |
Alur Kerja Praktikal untuk Latihan DP
Dalam pelaksanaan dunia nyata, melaksanakan DP kurang tentang teori dan lebih tentang penyelarasan dan pemantauan yang teliti.
Alur kerja tipikal kelihatan seperti ini:
- Definisikan sasaran privasi (ε, δ)
- Latihan model asas dengan DP-SGD
- Nilai pertukaran kegunaan vs privasi
- Terapkan Pengagregatan Selamat (jika tetapan teragregat)
- Eksperimen dengan DP-SAM jika ketepatan tidak mencukupi
- Gunakan akauntan privasi untuk pengesahan akhir
- Dokumentasikan hasil untuk pematuhan dan kebolehan audit
Kesimpulan Akhir
Privasi Berbeza bukanlah satu teknik tetapi pendekatan reka bentuk sistem.
DP-SGD menyediakan asas, Pengagregatan Selamat mengukuhkan keselamatan infrastruktur, dan DP-SAM membantu memulihkan prestasi apabila bunyi privasi menjadi terlalu mahal.
Dalam praktiknya, kebanyakan sistem dunia nyata bergantung pada gabungan ketiga-tiga elemen ini daripada menggunakan satu kaedah secara terasing.




