Aprendizaje por refuerzo explicado para expertos


El aprendizaje por refuerzo es un área del aprendizaje automático en la que un agente aprende a tomar decisiones óptimas en un entorno, basándose en la maximización de la recompensa acumulativa esperada.

Formalmente, el AR se modela a menudo mediante procesos de decisión de Markov (MDP), definidos por el espacio de estados, espacio de acciones, probabilidades de transición y función de recompensa.

La tarea central consiste en encontrar una política π(s) que maximice el retorno esperado, utilizando métodos como iteración de valores, iteración de políticas, métodos Monte Carlo y aprendizaje por diferencia temporal (p. ej., Q-Learning, SARSA).

Enfoques modernos como el aprendizaje profundo por refuerzo combinan redes neuronales con algoritmos de AR para aprender en entornos complejos y de alta dimensión.


Definición:
El aprendizaje por refuerzo es un paradigma de aprendizaje en el que un agente aprende una política a través de la interacción con un entorno que maximiza la recompensa acumulativa, típicamente modelado como un proceso de decisión de Markov.


Fuente:
Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction. MIT Press.