Apprentissage par renforcement fédéré expliqué pour les experts


L'apprentissage par renforcement fédéré (Federated Reinforcement Learning, FRL) désigne un cadre qui combine l'apprentissage fédéré avec l'apprentissage par renforcement (Reinforcement Learning, RL) afin d'entraîner des politiques sur plusieurs agents distribués sans centraliser les données locales.

Formellement, chaque agent i optimise sa politique locale \(\pi_i\) basée sur des interactions locales avec l'environnement, tandis qu'un modèle global \(\pi_G\) est obtenu par agrégation des mises à jour locales, par exemple via une moyenne pondérée des gradients ou des paramètres :

\[ \pi_G = \sum_{i=1}^N w_i \pi_i \quad \text{avec} \quad \sum_{i=1}^N w_i = 1 \]

L'agrégation se fait typiquement en tours de communication, où des algorithmes comme FedAvg sont adaptés pour combiner les gradients de politique ou les fonctions de valeur.

Le FRL traite des défis tels que les distributions de données non IID, les environnements dynamiques et les mises à jour asynchrones.

Il utilise des techniques issues du RL multi-agent, de l'apprentissage fédéré et optimise les stratégies de communication pour garantir efficacité et confidentialité.


Définition :
« L'apprentissage par renforcement fédéré est un paradigme d'apprentissage où plusieurs agents distribués coopèrent via des processus locaux d'apprentissage par renforcement et agrègent leurs modèles sans échanger les données brutes, afin d'apprendre conjointement des politiques optimales. »


Source :
Li, T., Sahu, A. K., Talwalkar, A., & Smith, V. (2020). Federated Learning: Challenges, Methods, and Future Directions. IEEE Signal Processing Magazine.