Self-Play expliqué pour les experts


Self-Play désigne un paradigme d'apprentissage dans lequel un agent A dans un environnement E joue contre lui-même ou contre des versions historiques A' afin de développer des stratégies optimales par interaction.

Formellement, le Self-Play peut être modélisé comme une procédure d'optimisation itérative et multi-étapes dans le cadre des processus de décision de Markov (MDP) ou des jeux multi-agents, où l'agent met à jour sa politique \( \pi \) par interaction avec \( \pi' \).

Des applications connues sont AlphaGo (Silver et al., 2016), où l'apprentissage par renforcement profond a été combiné avec la recherche arborescente Monte-Carlo et le Self-Play pour atteindre une performance surhumaine.

Le Self-Play permet d'atteindre des états d'équilibre (par exemple des équilibres de Nash) dans des scénarios multi-joueurs et est particulièrement efficace dans des environnements sans données d'entraînement disponibles.

Le défi central consiste à garantir la stabilité et la diversité des stratégies afin d'éviter que l'apprentissage ne tombe dans des cycles sous-optimaux.


Définition :
« Le Self-Play est une méthode d'apprentissage dans laquelle un agent améliore ses propres stratégies en jouant contre lui-même ou contre des versions historiques, afin d'apprendre des comportements optimaux dans un environnement. »


Source :
Silver, D., Huang, A., Maddison, C. J., et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529(7587), 484–489.