Le Self-Play est une méthode d'entraînement où un agent joue contre une copie de lui-même ou contre des versions antérieures afin de développer et d'améliorer des stratégies.
Grâce à cette méthode, l'agent peut apprendre sans données externes, en générant ses propres expériences et en en tirant des enseignements.
Le Self-Play est souvent utilisé en combinaison avec l'apprentissage par renforcement pour développer des stratégies de jeu fortes dans des jeux à fort enjeu stratégique, comme le Go ou le poker.
Les techniques importantes incluent l'entraînement contre soi-même dans un processus itératif, l'utilisation des soi-disant « équilibres de Nash » et l'évitement du surapprentissage des versions antérieures.
Le Self-Play permet de découvrir des comportements complexes qui ne sont pas facilement trouvés par l'apprentissage traditionnel à partir d'exemples.