Self-Play es un método de entrenamiento en el que un agente juega contra una copia de sí mismo o contra versiones anteriores para desarrollar y mejorar estrategias.
A través de este método, el agente puede aprender sin datos externos, generando y aprendiendo de sus propias experiencias.
Self-Play se utiliza a menudo en combinación con el aprendizaje por refuerzo para desarrollar estrategias de juego fuertes en juegos con alta exigencia estratégica, como Go o póker.
Las técnicas importantes incluyen el entrenamiento contra uno mismo en un proceso iterativo, el uso de los llamados «equilibrios de Nash» y la evitación del sobreajuste a versiones anteriores.
Self-Play permite descubrir comportamientos complejos que no son fáciles de encontrar mediante el aprendizaje convencional a partir de datos de ejemplo.