Aprendizaje por Refuerzo Federado explicado para expertos


El Aprendizaje por Refuerzo Federado (FRL) se refiere a un marco que combina el aprendizaje federado con el Aprendizaje por Refuerzo (Reinforcement Learning, RL) para entrenar políticas a través de múltiples agentes distribuidos, sin centralizar los datos locales.

Formalmente, cada agente i optimiza su política local \(\pi_i\) basada en interacciones locales con el entorno, mientras que un modelo global \(\pi_G\) se genera mediante la agregación de actualizaciones locales, por ejemplo, mediante un promedio ponderado de gradientes o parámetros:

\[ \pi_G = \sum_{i=1}^N w_i \pi_i \quad \text{con} \quad \sum_{i=1}^N w_i = 1 \]

La agregación suele realizarse en rondas de comunicación, adaptando algoritmos como FedAvg para combinar gradientes de políticas o funciones de valor.

FRL aborda desafíos como distribuciones de datos no IID, entornos dinámicos y actualizaciones asíncronas.

Utiliza técnicas de RL multiagente, aprendizaje federado y optimiza estrategias de comunicación para garantizar eficiencia y privacidad.


Definición:
«El Aprendizaje por Refuerzo Federado es un paradigma de aprendizaje en el que múltiples agentes distribuidos cooperan mediante procesos locales de aprendizaje por refuerzo y agregan sus modelos sin intercambiar datos en bruto, para aprender conjuntamente políticas óptimas.»


Fuente:
Li, T., Sahu, A. K., Talwalkar, A., & Smith, V. (2020). Federated Learning: Challenges, Methods, and Future Directions. IEEE Signal Processing Magazine.