Обучение с подкреплением — это вид машинного обучения, при котором компьютер учится принимать решения, пробуя и извлекая уроки из своего опыта.
Можно представить это как игру, в которой компьютер выбирает действие и получает за это награду или наказание.
Цель — с помощью множества попыток выяснить, какие действия являются лучшими для получения максимального количества наград.
Например, робот может научиться перемещаться по комнате, пробуя, что работает, а что нет.
Таким образом, система становится всё лучше в принятии правильных решений, даже если изначально она не знала, что правильно.