Обучение с подкреплением — это область машинного обучения, в которой агент учится принимать оптимальные решения в среде, основываясь на максимизации ожидаемого кумулятивного вознаграждения.
Формально обучение с подкреплением часто моделируется с помощью марковских процессов принятия решений (MDP), определяемых пространством состояний, пространством действий, вероятностями переходов и функцией вознаграждения.
Основная задача состоит в нахождении политики π(s), которая максимизирует ожидаемую отдачу, при этом применяются методы, такие как итерация по значениям, итерация по политикам, методы Монте-Карло и обучение с временной разницей (например, Q-обучение, SARSA).
Современные подходы, такие как глубокое обучение с подкреплением, сочетают нейронные сети с алгоритмами обучения с подкреплением для обучения в сложных, высокоразмерных средах.
Определение:
Обучение с подкреплением — это парадигма обучения, при которой агент через взаимодействие со средой изучает политику, максимизирующую кумулятивное вознаграждение, обычно моделируемую как марковский процесс принятия решений.
Источник:
Саттон, Р. С., и Барто, А. Г. (2018). Reinforcement Learning: An Introduction. MIT Press.