联邦强化学习(Federated Reinforcement Learning,FRL)指的是一种将联邦学习与强化学习(Reinforcement Learning,RL)相结合的框架,用于训练多个分布式智能体的策略,而无需集中本地数据。
形式上,每个智能体 \(i\) 基于与环境的本地交互优化其本地策略 \(\pi_i\),同时通过聚合本地更新形成全局模型 \(\pi_G\),例如通过梯度或参数的加权平均:
\[ \pi_G = \sum_{i=1}^N w_i \pi_i \quad \text{其中} \quad \sum_{i=1}^N w_i = 1 \]
聚合通常在通信轮次中进行,采用如 FedAvg 等算法进行调整,以结合策略梯度或价值函数。
FRL 解决了非独立同分布(Non-IID)数据分布、动态环境和异步更新等挑战。
它利用多智能体强化学习、联邦学习的技术,并优化通信策略,以确保效率和隐私保护。
定义:
“联邦强化学习是一种学习范式,其中多个分布式智能体通过本地强化学习过程协作并聚合其模型,而不交换原始数据,以共同学习最优策略。”
来源:
Li, T., Sahu, A. K., Talwalkar, A., & Smith, V. (2020). 联邦学习:挑战、方法与未来方向。IEEE 信号处理杂志。