Dans cette vidéo, nous allons découvrir deux excellentes méthodes d'apprentissage par renforcement pour l'exploration auto-supervisée - Curiosité et Distillation de Réseau Aléatoire (RND). Nous utiliserons un algorithme d'apprentissage par renforcement on-policy populaire (A2C ou Advantage Actor-Critic) pour explorer cet espace fascinant. En cours de route, nous apprendrons quelques exemples de code en Python et Pytorch, et étudierons pourquoi ces méthodes fonctionnent exactement et les divers défis qu'elles résolvent. La curiosité apprend aux agents à explorer les états qu'ils trouvent les moins prévisibles, et RND apprend aux agents à explorer les états les plus "nouveaux". Les architectures de réseaux neuronaux derrière les deux sont incroyablement simples mais géniales, et elles évitent les solutions de hacking de récompense bruyantes pour une approche de récompense intrinsèque plus rationalisée.
#reinforcementlearning #ai #deeplearning
Les membres ont accès à TOUT ce qui se passe en coulisses pour produire mes vidéos. De plus, cela soutient la chaîne de manière significative et aide à payer mes factures.
Articles :