Mira cómo una IA aprende a explorar y encontrar la mejor recompensa.
En este video, entramos en un simple mundo de cuadrícula donde un agente navega a través de túneles en busca de tesoros. Hay dos opciones: una pequeña recompensa cerca del punto de partida y una recompensa mayor que requiere un camino más largo y más incierto.
Al principio, el agente a menudo se conforma con la victoria fácil. Esto lleva a una solución subóptima, donde elige repetidamente el tesoro más pequeño en lugar de descubrir el mejor. El desafío clave es la exploración.
A través de animaciones intuitivas, mostramos cómo el agente equilibra la prueba de nuevos caminos con el uso de lo que ya sabe. Al mismo tiempo, la memoria interna del agente se visualiza y evoluciona paso a paso. Verás cómo sus valores aprendidos cambian a medida que gana experiencia y cómo esta memoria eventualmente lo guía hacia la mejor elección.
📺 Este video es parte de la serie:
Aprendizaje por Refuerzo Explicado – Ejemplos Animados
La teoría está excluida en esta versión