强化学习(RL)是一种学习范式,代理通过与环境的交互和奖励反馈来学习最优策略。
代理观察当前状态,选择一个动作,随后获得奖励和下一个状态。
目标是找到一种策略,使长期累计奖励最大化。
重要概念包括马尔可夫决策过程(MDP)、价值函数和Q学习。
强化学习应用于机器人、游戏和自主系统等领域,在这些领域中通过试错学习成为可能。