Self-Play ist eine Trainingsmethode, bei der ein Agent gegen eine Kopie seiner selbst oder gegen frühere Versionen spielt, um Strategien zu entwickeln und zu verbessern.
Durch diese Methode kann der Agent ohne externe Daten lernen, indem er eigene Erfahrungen generiert und daraus lernt.
Self-Play wird oft in Kombination mit Reinforcement Learning eingesetzt, um in Spielen mit hohem strategischen Anspruch, wie Go oder Poker, starke Spielstrategien zu entwickeln.
Wichtige Techniken sind dabei das Training gegen sich selbst im iterativen Prozess, das Nutzen von sogenannten „Nash-Equilibrien“ und das Vermeiden von Überanpassung an frühere Versionen.
Self-Play ermöglicht es, komplexe Verhaltensweisen zu entdecken, die durch herkömmliches Lernen von Beispieldaten nicht leicht zu finden sind.