Self-Play se refiere a un paradigma de aprendizaje en el que un agente A en un entorno E juega contra sí mismo o contra versiones históricas A' para desarrollar estrategias óptimas mediante la interacción.
Formalmente, Self-Play puede modelarse como un procedimiento iterativo de optimización multinivel en el marco de procesos de decisión de Markov (MDPs) o juegos con múltiples agentes, donde el agente actualiza su política \( \pi \) mediante la interacción con \( \pi' \).
Aplicaciones conocidas son AlphaGo (Silver et al., 2016), donde se combinó el aprendizaje profundo por refuerzo con búsqueda en árbol Monte-Carlo y Self-Play para alcanzar un nivel de juego sobrehumano.
Self-Play permite alcanzar estados de equilibrio (por ejemplo, equilibrios de Nash) en escenarios multijugador y es especialmente eficaz en entornos sin datos de entrenamiento disponibles.
El desafío central consiste en garantizar la estabilidad y diversidad de las estrategias para evitar que el aprendizaje caiga en ciclos subóptimos.
Definición:
«Self-Play es un procedimiento de aprendizaje en el que un agente mejora sus propias estrategias jugando contra sí mismo o contra versiones históricas para aprender comportamientos óptimos en un entorno.»
Fuente:
Silver, D., Huang, A., Maddison, C. J., et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529(7587), 484–489.