El aprendizaje por refuerzo es un área del aprendizaje automático en la que un agente aprende a tomar decisiones óptimas en un entorno, basándose en la maximización de la recompensa acumulativa esperada.
Formalmente, el AR se modela a menudo mediante procesos de decisión de Markov (MDP), definidos por el espacio de estados, espacio de acciones, probabilidades de transición y función de recompensa.
La tarea central consiste en encontrar una política π(s) que maximice el retorno esperado, utilizando métodos como iteración de valores, iteración de políticas, métodos Monte Carlo y aprendizaje por diferencia temporal (p. ej., Q-Learning, SARSA).
Enfoques modernos como el aprendizaje profundo por refuerzo combinan redes neuronales con algoritmos de AR para aprender en entornos complejos y de alta dimensión.
Definición:
El aprendizaje por refuerzo es un paradigma de aprendizaje en el que un agente aprende una política a través de la interacción con un entorno que maximiza la recompensa acumulativa, típicamente modelado como un proceso de decisión de Markov.
Fuente:
Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction. MIT Press.