En esta parte de la serie, nos enfocamos en una de las estrategias clave en el Aprendizaje por Refuerzo—la Exploración Aleatoria—dentro del contexto del problema del Bandido de Multi-Brazos. Demuestro cómo un agente de aprendizaje por refuerzo puede explorar diferentes opciones (o brazos) de manera aleatoria, recopilando recompensas y aprendiendo de cada interacción.
Implementamos un algoritmo de exploración aleatoria en Python, simulando múltiples iteraciones donde cada brazo es seleccionado al azar. La recompensa se calcula en función de las probabilidades del entorno, y calculamos la recompensa promedio para cada brazo en función del número de visitas. Este enfoque simple pero efectivo sienta las bases para estrategias de RL más sofisticadas en episodios futuros.
Si buscas entender cómo la aleatoriedad juega un papel en el aprendizaje por refuerzo y quieres verlo en acción, ¡este video es para ti!