Nous avons créé un outil pour concevoir et simuler des processus de décision de Markov (MDP) simples et exécuter des algorithmes d'apprentissage par renforcement (RL) afin d'aider à renforcer votre intuition pour ces algorithmes. Les étudiants rencontrent souvent des difficultés à saisir la dynamique complexe des algorithmes RL et l'effet des hyperparamètres sur l'apprentissage des agents. Cet outil est destiné aux étudiants inscrits dans des cours d'introduction à avancés en intelligence artificielle qui contiennent des concepts d'apprentissage par renforcement. L'objectif principal d'apprentissage est d'aider les étudiants à comprendre les concepts fondamentaux du RL, y compris l'estimation de valeur, l'optimisation de politique et les compromis exploration-exploitation, de manière pratique et ludique. Grâce à cet outil, les étudiants peuvent concevoir des MDP en grille 2D personnalisés, modifier les récompenses et ajuster des hyperparamètres tels que les taux d'apprentissage, les facteurs d'actualisation, et bien d'autres. Ils peuvent visualiser comment leurs environnements et paramètres choisis impactent le taux de convergence et la performance des algorithmes RL.
Projet sur GitHub : AbhishekVarghese/Markov-Decision-Problem-Simulation
Crédits :
Musique : Hanami Matsuri par Fabian Measures
Voix générées par le remarquable texte à voix de app.fliki.ai
Images empruntées à Slides par Dan Klein et Pieter Abbeel de UC Berkley
Prezi pour leur incroyable logiciel de présentation !
Chat-GPT pour avoir proposé le brouillon initial de cette description vidéo !