Tutorial Privasi Diferensial: DP‑SGD, DP‑SAM, dan Aggregasi Aman Dijelaskan

Blog

Oleh Wendy Frey

86643f6b-1fdd-4e74-866f-9250e22a8ce4-1200x600.webp Privasi Diferensial (DP) telah menjadi blok bangunan inti dalam sistem pembelajaran mesin modern di mana perlindungan data pengguna bukanlah pilihan, tetapi suatu keharusan. Alih-alih bergantung pada kepercayaan, DP memberikan jaminan matematis bahwa titik data individual tidak secara signifikan mempengaruhi model akhir.

Dalam istilah yang lebih sederhana, bahkan jika data dari satu pengguna dihapus atau diubah, output dari model seharusnya tetap hampir sama.

Ide ini biasanya diformalkan melalui dua parameter:

  • ε (epsilon), seberapa banyak informasi tentang individu yang dapat bocor (semakin rendah semakin baik)
  • δ (delta), probabilitas kecil bahwa jaminan mungkin tidak berlaku dengan sempurna

Tantangan dalam ML dunia nyata bukanlah mendefinisikan DP, tetapi membuatnya bekerja secara efisien tanpa menghancurkan kinerja model.

DP-SGD: Pekerja Keras Privasi Diferensial

Sebagian besar sistem DP praktis dibangun di atas DP-SGD (Differentially Private Stochastic Gradient Descent). Ini memodifikasi SGD standar dengan dua cara kunci.

Cara DP-SGD bekerja

Alih-alih langsung menggunakan gradien mentah dari setiap contoh pelatihan, DP-SGD menerapkan:

  1. Pemangkasan gradien, membatasi pengaruh dari setiap sampel tunggal
  2. Penyisipan noise, menambahkan noise Gaussian untuk menyembunyikan kontribusi individual

Kombinasi ini memastikan bahwa tidak ada titik data tunggal yang dapat mendominasi proses pembelajaran.

Parameter kunci dalam DP-SGD

ParameterApa yang dikendalikanMengapa itu penting
Pemangkasan normaUkuran gradien maksimum per sampelMencegah pengaruh dari outlier mendominasi pembaruan
Pengali noiseJumlah noise Gaussian yang ditambahkanMemengaruhi langsung tradeoff privasi-utilitas
Tingkat pengambilanFraksi data per langkahMempengaruhi konsumsi anggaran privasi
EpochsJumlah putaran pelatihanLebih banyak epochs = lebih banyak biaya privasi

Satu catatan praktis yang penting: epsilon bukanlah sesuatu yang “dipilih berdasarkan intuisi”. Itu dihitung menggunakan akuntan privasi, yang melacak kerugian privasi kumulatif selama pelatihan.

Aggregasi Aman vs Privasi Diferensial

Kedua konsep ini sering bingung, tetapi mereka menyelesaikan masalah yang berbeda.

Aggregasi Aman melindungi data selama transmisi, sedangkan Privasi Diferensial melindungi output model akhir.

FiturAggregasi AmanPrivasi Diferensial
Apa yang dilindungiPembaruan klien saat transitKebocoran informasi dari model
Saat itu berlakuSelama komunikasiSetelah pelatihan
Tujuan utamaMenyembunyikan gradien individualMembatasi pengaruh dari pengguna mana pun
Model ancamanServer hanya melihat data agregatOutput model tidak boleh membocorkan informasi

Dalam sistem produksi, mereka sering digunakan bersamaan:

Aggregasi Aman + DP = privasi end-to-end yang lebih kuat

DP-SAM: Meningkatkan Akurasi di Bawah Kendala Privasi

Salah satu kelemahan terbesar DP-SGD adalah penurunan kinerja akibat noise. Di sinilah DP-SAM (Differentially Private Sharpness-Aware Minimization) masuk.

Ide di balik DP-SAM sederhana tetapi kuat:

Alih-alih melatih model di minima tajam (wilayah sensitif), ia mendorong optimasi menuju minima datar, di mana model lebih stabil.

Ini membantu karena:

  • noise memiliki dampak yang lebih sedikit di daerah datar
  • model lebih umum dalam kendala DP
  • kehilangan akurasi lebih rendah dibandingkan DP-SGD standar

Tradeoff-nya adalah biaya komputasional, karena pelatihan gaya SAM memerlukan langkah optimasi tambahan.

Perbandingan: DP-SGD vs DP-SAM

AspekDP-SGDDP-SAM
Jaminan privasiKuatKuat
Tujuan optimasiPelatihan standarOptimasi minima datar
Akurasi di bawah DPSering lebih rendahBiasanya lebih tinggi
Biaya komputasionalLebih rendahLebih tinggi
Kasus penggunaan terbaikPelatihan DP dasarModel DP berkualitas produksi

Alur Kerja Praktis untuk Pelatihan DP

Dalam penerapan nyata, menerapkan DP kurang tentang teori dan lebih tentang penyetelan dan pemantauan yang cermat.

Alur kerja yang biasa terlihat seperti ini:

  1. Tetapkan target privasi (ε, δ)
  2. Latih model dasar dengan DP-SGD
  3. Evaluasi tradeoff utilitas vs privasi
  4. Terapkan Aggregasi Aman (jika pengaturan terdistribusi)
  5. Bereksperimen dengan DP-SAM jika akurasi tidak mencukupi
  6. Gunakan akuntan privasi untuk validasi akhir
  7. Dokumentasikan hasil untuk kepatuhan dan auditabilitas

Kesimpulan Akhir

Privasi Diferensial bukanlah teknik tunggal tetapi pendekatan desain sistem.

DP-SGD memberikan fondasi, Aggregasi Aman memperkuat keamanan infrastruktur, dan DP-SAM membantu memulihkan kinerja ketika noise privasi menjadi terlalu mahal.

Dalam praktiknya, sebagian besar sistem dunia nyata mengandalkan kombinasi ketiga elemen tersebut daripada satu metode secara terpisah.

Template viral

Jelajahi template AI viral kami dan terapkan ke fotomu.

Jelajahi template