Обучение с подкреплением (RL) — это парадигма обучения, при которой агент в среде через взаимодействие и обратную связь в виде вознаграждений изучает оптимальную стратегию.
Агент наблюдает текущее состояние, выбирает действие и получает вознаграждение, а также следующее состояние.
Цель — найти политику, которая максимизирует долгосрочное накопленное вознаграждение.
Важные концепции включают марковские процессы принятия решений (MDP), функции ценности и Q-обучение.
RL применяется в таких областях, как робототехника, игры и автономные системы, где обучение возможно через пробу и ошибку.