Tutorial Privasi Diferensial: DP‑SGD, DP‑SAM, dan Aggregasi Aman Dijelaskan
Oleh Wendy Frey
Privasi Diferensial (DP) telah menjadi blok bangunan inti dalam sistem pembelajaran mesin modern di mana perlindungan data pengguna bukanlah pilihan, tetapi suatu keharusan. Alih-alih bergantung pada kepercayaan, DP memberikan jaminan matematis bahwa titik data individual tidak secara signifikan mempengaruhi model akhir.
Dalam istilah yang lebih sederhana, bahkan jika data dari satu pengguna dihapus atau diubah, output dari model seharusnya tetap hampir sama.
Ide ini biasanya diformalkan melalui dua parameter:
- ε (epsilon), seberapa banyak informasi tentang individu yang dapat bocor (semakin rendah semakin baik)
- δ (delta), probabilitas kecil bahwa jaminan mungkin tidak berlaku dengan sempurna
Tantangan dalam ML dunia nyata bukanlah mendefinisikan DP, tetapi membuatnya bekerja secara efisien tanpa menghancurkan kinerja model.
DP-SGD: Pekerja Keras Privasi Diferensial
Sebagian besar sistem DP praktis dibangun di atas DP-SGD (Differentially Private Stochastic Gradient Descent). Ini memodifikasi SGD standar dengan dua cara kunci.
Cara DP-SGD bekerja
Alih-alih langsung menggunakan gradien mentah dari setiap contoh pelatihan, DP-SGD menerapkan:
- Pemangkasan gradien, membatasi pengaruh dari setiap sampel tunggal
- Penyisipan noise, menambahkan noise Gaussian untuk menyembunyikan kontribusi individual
Kombinasi ini memastikan bahwa tidak ada titik data tunggal yang dapat mendominasi proses pembelajaran.
Parameter kunci dalam DP-SGD
| Parameter | Apa yang dikendalikan | Mengapa itu penting |
|---|---|---|
| Pemangkasan norma | Ukuran gradien maksimum per sampel | Mencegah pengaruh dari outlier mendominasi pembaruan |
| Pengali noise | Jumlah noise Gaussian yang ditambahkan | Memengaruhi langsung tradeoff privasi-utilitas |
| Tingkat pengambilan | Fraksi data per langkah | Mempengaruhi konsumsi anggaran privasi |
| Epochs | Jumlah putaran pelatihan | Lebih banyak epochs = lebih banyak biaya privasi |
Satu catatan praktis yang penting: epsilon bukanlah sesuatu yang “dipilih berdasarkan intuisi”. Itu dihitung menggunakan akuntan privasi, yang melacak kerugian privasi kumulatif selama pelatihan.
Aggregasi Aman vs Privasi Diferensial
Kedua konsep ini sering bingung, tetapi mereka menyelesaikan masalah yang berbeda.
Aggregasi Aman melindungi data selama transmisi, sedangkan Privasi Diferensial melindungi output model akhir.
| Fitur | Aggregasi Aman | Privasi Diferensial |
|---|---|---|
| Apa yang dilindungi | Pembaruan klien saat transit | Kebocoran informasi dari model |
| Saat itu berlaku | Selama komunikasi | Setelah pelatihan |
| Tujuan utama | Menyembunyikan gradien individual | Membatasi pengaruh dari pengguna mana pun |
| Model ancaman | Server hanya melihat data agregat | Output model tidak boleh membocorkan informasi |
Dalam sistem produksi, mereka sering digunakan bersamaan:
Aggregasi Aman + DP = privasi end-to-end yang lebih kuat
DP-SAM: Meningkatkan Akurasi di Bawah Kendala Privasi
Salah satu kelemahan terbesar DP-SGD adalah penurunan kinerja akibat noise. Di sinilah DP-SAM (Differentially Private Sharpness-Aware Minimization) masuk.
Ide di balik DP-SAM sederhana tetapi kuat:
Alih-alih melatih model di minima tajam (wilayah sensitif), ia mendorong optimasi menuju minima datar, di mana model lebih stabil.
Ini membantu karena:
- noise memiliki dampak yang lebih sedikit di daerah datar
- model lebih umum dalam kendala DP
- kehilangan akurasi lebih rendah dibandingkan DP-SGD standar
Tradeoff-nya adalah biaya komputasional, karena pelatihan gaya SAM memerlukan langkah optimasi tambahan.
Perbandingan: DP-SGD vs DP-SAM
| Aspek | DP-SGD | DP-SAM |
|---|---|---|
| Jaminan privasi | Kuat | Kuat |
| Tujuan optimasi | Pelatihan standar | Optimasi minima datar |
| Akurasi di bawah DP | Sering lebih rendah | Biasanya lebih tinggi |
| Biaya komputasional | Lebih rendah | Lebih tinggi |
| Kasus penggunaan terbaik | Pelatihan DP dasar | Model DP berkualitas produksi |
Alur Kerja Praktis untuk Pelatihan DP
Dalam penerapan nyata, menerapkan DP kurang tentang teori dan lebih tentang penyetelan dan pemantauan yang cermat.
Alur kerja yang biasa terlihat seperti ini:
- Tetapkan target privasi (ε, δ)
- Latih model dasar dengan DP-SGD
- Evaluasi tradeoff utilitas vs privasi
- Terapkan Aggregasi Aman (jika pengaturan terdistribusi)
- Bereksperimen dengan DP-SAM jika akurasi tidak mencukupi
- Gunakan akuntan privasi untuk validasi akhir
- Dokumentasikan hasil untuk kepatuhan dan auditabilitas
Kesimpulan Akhir
Privasi Diferensial bukanlah teknik tunggal tetapi pendekatan desain sistem.
DP-SGD memberikan fondasi, Aggregasi Aman memperkuat keamanan infrastruktur, dan DP-SAM membantu memulihkan kinerja ketika noise privasi menjadi terlalu mahal.
Dalam praktiknya, sebagian besar sistem dunia nyata mengandalkan kombinasi ketiga elemen tersebut daripada satu metode secara terpisah.




