El aprendizaje por refuerzo (RL) es un paradigma de aprendizaje en el que un agente en un entorno aprende una estrategia óptima mediante la interacción y la retroalimentación en forma de recompensas.
El agente observa el estado actual, elige una acción y recibe a continuación una recompensa así como el siguiente estado.
El objetivo es encontrar una política que maximice la recompensa acumulada a largo plazo.
Conceptos importantes son los procesos de decisión de Markov (MDP), las funciones de valor y el Q-Learning.
El RL se utiliza en áreas como la robótica, los juegos y los sistemas autónomos, donde el aprendizaje por prueba y error es posible.