El aprendizaje por refuerzo es un tipo de aprendizaje automático en el que un ordenador aprende a tomar decisiones probando y aprendiendo de sus experiencias.
Se puede imaginar como un juego en el que el ordenador selecciona una acción y recibe una recompensa o un castigo por ello.
El objetivo es descubrir, mediante muchos intentos, cuáles son las mejores acciones para obtener la mayor cantidad de recompensas.
Por ejemplo, un robot puede aprender cómo moverse en una habitación probando qué funciona y qué no.
Así, el sistema mejora cada vez más en tomar buenas decisiones, incluso cuando antes no sabía exactamente qué era correcto.