差分隐私联邦学习是一种学习范式,通过聚合在分布式数据源上本地训练的模型来构建全局模型 \(f_\theta\),同时差分隐私(DP)确保单个数据点的参与不可被追踪。
形式上,在每次通信步骤中,对本地更新 \( \Delta \theta_i \) 应用一个DP机制 \( \mathcal{M} \),例如通过添加高斯噪声 \( \mathcal{N}(0, \sigma^2) \),使得:
\[ \mathcal{M}(\Delta \theta_i) = \Delta \theta_i + \mathcal{N}(0, \sigma^2 I) \]
总体隐私通过各步骤的组合以参数 \( (\varepsilon, \delta) \) 来衡量。
通过将联邦平均(FedAvg)与DP机制结合,可以训练模型而不会从本地数据中提取敏感信息。
这解决了在分布式学习中数学上保证隐私同时保持高模型质量的挑战。
定义:
“差分隐私联邦学习是一种分布式学习方法,通过对本地模型更新添加数学定义的噪声,以保护参与者隐私,同时训练全局模型。”
来源:
McMahan, H. B., Ramage, D., Talwar, K., & Zhang, L. (2018). Learning Differentially Private Recurrent Language Models. Proceedings of the 6th International Conference on Learning Representations (ICLR).