Федеративное обучение с подкреплением (Federated Reinforcement Learning, FRL) обозначает фреймворк, который сочетает федеративное обучение с обучением с подкреплением (Reinforcement Learning, RL) для обучения политик на нескольких распределённых агентах без централизации локальных данных.
Формально каждый агент i оптимизирует свою локальную политику \(\pi_i\) на основе локальных взаимодействий с окружением, в то время как глобальная модель \(\pi_G\) формируется путём агрегации локальных обновлений, например, через взвешенное среднее градиентов или параметров:
\[ \pi_G = \sum_{i=1}^N w_i \pi_i \quad \text{с условием} \quad \sum_{i=1}^N w_i = 1 \]
Агрегация обычно происходит в раундах коммуникации, при этом адаптируются алгоритмы, такие как FedAvg, для объединения градиентов политики или функций ценности.
FRL решает задачи, связанные с неоднородным распределением данных (Non-IID), динамическими окружениями и асинхронными обновлениями.
Он использует методы из многопользовательского обучения с подкреплением, федеративного обучения и оптимизирует коммуникационные стратегии для обеспечения эффективности и конфиденциальности.
Определение:
«Федеративное обучение с подкреплением — это парадигма обучения, при которой несколько распределённых агентов сотрудничают через локальные процессы обучения с подкреплением и агрегируют свои модели без обмена необработанными данными, чтобы совместно обучать оптимальные политики.»
Источник:
Li, T., Sahu, A. K., Talwalkar, A., & Smith, V. (2020). Federated Learning: Challenges, Methods, and Future Directions. IEEE Signal Processing Magazine.