自我对弈指的是一种学习范式,其中代理A在环境E中与自身或历史版本A'对弈,通过交互来发展最优策略。
形式上,自我对弈可以被建模为多阶段、迭代的优化过程,基于马尔可夫决策过程(MDP)或多代理博弈框架,代理通过与\( \pi' \)的交互来更新其策略\( \pi \)。
著名应用包括AlphaGo(Silver等,2016),该方法将深度强化学习与蒙特卡洛树搜索和自我对弈结合,实现了超越人类的棋力。
自我对弈使得在多玩家场景中达到均衡状态(例如纳什均衡)成为可能,且在无现成训练数据的环境中尤为有效。
核心挑战在于保证策略的稳定性和多样性,避免学习陷入次优循环。
定义:
“自我对弈是一种学习方法,代理通过与自身或历史版本对弈来改进策略,从而学习在环境中实现最优行为。”
来源:
Silver, D., Huang, A., Maddison, C. J., 等. (2016). 利用深度神经网络和树搜索掌握围棋游戏。Nature, 529(7587), 484–489。