Regardez comment une IA apprend à explorer et à trouver la meilleure récompense.
Dans cette vidéo, nous entrons dans un simple monde en grille où un agent navigue à travers des tunnels à la recherche de trésors. Il y a deux options : une petite récompense proche du point de départ, et une plus grande récompense qui nécessite un chemin plus long et plus incertain.
Au début, l'agent se contente souvent de la victoire facile. Cela conduit à une solution sous-optimale, où il choisit à plusieurs reprises le petit trésor au lieu de découvrir le meilleur. Le principal défi est l'exploration.
À travers des animations intuitives, nous montrons comment l'agent équilibre l'essai de nouveaux chemins avec l'utilisation de ce qu'il sait déjà. En même temps, la mémoire interne de l'agent est visualisée et évolue étape par étape. Vous verrez comment ses valeurs apprises changent au fur et à mesure qu'il acquiert de l'expérience, et comment cette mémoire le guide finalement vers le meilleur choix.
📺 Cette vidéo fait partie de la série :
Apprentissage par renforcement expliqué – Exemples animés
La théorie est exclue dans cette version