强化学习是机器学习的一个领域,其中智能体通过最大化预期累计奖励来学习在环境中做出最优决策。
形式上,强化学习通常通过马尔可夫决策过程(MDP)建模,定义为状态空间、动作空间、转移概率和奖励函数。
核心任务是找到一个策略 π(s),以最大化预期回报,常用的方法包括值迭代、策略迭代、蒙特卡洛方法和时序差分学习(如 Q 学习、SARSA)。
现代方法如深度强化学习结合神经网络与强化学习算法,以在复杂的高维环境中进行学习。
定义:
强化学习是一种学习范式,智能体通过与环境交互学习策略,以最大化累计奖励,通常建模为马尔可夫决策过程。
来源:
Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction. MIT Press.