Aprendizaje Federado con Privacidad Diferencial explicado para expertos


El aprendizaje federado con privacidad diferencial se refiere a un paradigma de aprendizaje en el que un modelo global \(f_ heta\) se crea mediante la agregación de modelos entrenados localmente en fuentes de datos distribuidas, mientras que la privacidad diferencial (DP) asegura que la participación de puntos de datos individuales no sea rastreable.

Formalmente, en cada paso de comunicación se aplica un mecanismo DP \( \mathcal{M} \) a las actualizaciones locales \( \Delta heta_i \), por ejemplo, añadiendo ruido gaussiano \( \mathcal{N}(0, \sigma^2) \), de modo que se cumple:

\[ \mathcal{M}(\Delta heta_i) = \Delta heta_i + \mathcal{N}(0, \sigma^2 I) \]

La privacidad total se mide mediante la composición de los pasos individuales con parámetros \( (\varepsilon, \delta) \).

Mediante la combinación de Federated Averaging (FedAvg) con mecanismos DP, el modelo puede entrenarse sin que se puedan extraer informaciones sensibles de los datos locales.

Esto aborda el desafío de garantizar matemáticamente la privacidad en el aprendizaje distribuido y, al mismo tiempo, mantener una alta calidad del modelo.


Definición:
«El aprendizaje federado con privacidad diferencial es un procedimiento de aprendizaje distribuido en el que las actualizaciones locales del modelo se perturban con ruido definido matemáticamente para proteger la privacidad de los participantes y, al mismo tiempo, entrenar un modelo global.»


Fuente:
McMahan, H. B., Ramage, D., Talwar, K., & Zhang, L. (2018). Learning Differentially Private Recurrent Language Models. Proceedings of the 6th International Conference on Learning Representations (ICLR).