Federated Learning mit Differential Privacy erklärt für Experten


Federated Learning mit Differential Privacy bezeichnet ein Lernparadigma, bei dem ein globales Modell \(f_ heta\) durch Aggregation von lokal trainierten Modellen auf verteilten Datenquellen erstellt wird, während Differential Privacy (DP) sicherstellt, dass die Teilnahme einzelner Datenpunkte nicht nachvollziehbar ist.

Formal wird bei jedem Kommunikationsschritt ein DP-Mechanismus \( \mathcal{M} \) auf die lokalen Updates \( \Delta heta_i \) angewandt, z. B. durch das Hinzufügen von Gaußschem Rauschen \( \mathcal{N}(0, \sigma^2) \), sodass gilt:

\[ \mathcal{M}(\Delta heta_i) = \Delta heta_i + \mathcal{N}(0, \sigma^2 I) \]

Die Gesamtprivacy wird über die Komposition der einzelnen Schritte mit Parametern \( (\varepsilon, \delta) \) gemessen.

Durch die Kombination von Federated Averaging (FedAvg) mit DP-Mechanismen kann das Modell trainiert werden, ohne dass sensible Informationen aus den lokalen Daten extrahiert werden können.

Dies adressiert die Herausforderung, die Privatsphäre bei verteiltem Lernen mathematisch zu garantieren und gleichzeitig eine hohe Modellqualität zu erhalten.


Definition:
„Federated Learning mit Differential Privacy ist ein verteiltes Lernverfahren, bei dem lokale Modellupdates mit mathematisch definiertem Rauschen versehen werden, um die Privatsphäre der Teilnehmer zu schützen und gleichzeitig ein globales Modell zu trainieren.“


Quelle:
McMahan, H. B., Ramage, D., Talwar, K., & Zhang, L. (2018). Learning Differentially Private Recurrent Language Models. Proceedings of the 6th International Conference on Learning Representations (ICLR).