L'apprentissage par renforcement est un domaine de l'apprentissage automatique dans lequel un agent apprend à prendre des décisions optimales dans un environnement, basé sur la maximisation de la récompense cumulative attendue.
Formellement, l'AR est souvent modélisé par des processus de décision de Markov (MDP), définis par l'espace d'états, l'espace d'actions, les probabilités de transition et la fonction de récompense.
La tâche centrale consiste à trouver une politique π(s) qui maximise le retour attendu, en utilisant des méthodes telles que l'itération sur la valeur, l'itération sur la politique, les méthodes de Monte-Carlo et l'apprentissage par différence temporelle (par exemple Q-Learning, SARSA).
Les approches modernes comme le Deep Reinforcement Learning combinent des réseaux neuronaux avec des algorithmes d'AR pour apprendre dans des environnements complexes et de haute dimension.
Définition :
L'apprentissage par renforcement est un paradigme d'apprentissage dans lequel un agent apprend une politique par interaction avec un environnement, qui maximise la récompense cumulative, typiquement modélisé comme un processus de décision de Markov.
Source :
Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction. MIT Press.