#apprentissageparrenforcement #intelligenceartificielle
Dans le module 3, nous allons aborder un problème fondamental de l'apprentissage par renforcement : le dilemme exploration-exploitation.
Les agents intelligents doivent équilibrer leur désir de récompense à court terme avec la perspective d'obtenir des récompenses plus importantes à long terme. Nous explorons quelques stratégies différentes pour résoudre ce dilemme : valeurs initiales optimistes, epsilon-greedy et apprentissage hors politique.
Dans le module 4, nous allons appliquer tout cela au contexte de la résolution de problèmes avec la programmation dynamique, alors restez à l'écoute.
Apprenez à transformer des articles sur l'apprentissage par renforcement profond en code :
Accédez instantanément à tous mes cours, y compris le nouveau cours sur la Répétition d'Expérience Priorisée, avec mon service d'abonnement. 29 $ par mois vous donne un accès instantané à 42 heures de contenu pédagogique, plus l'accès aux mises à jour futures, ajoutées chaque mois.
Des réductions sont disponibles pour les étudiants Udemy (inscrits depuis plus de 30 jours). Envoyez simplement un e-mail à sales@neuralnet.ai
Ou, procurez-vous mes cours Udemy ici :
Apprentissage Q Profond :
Méthodes Acteur Critique :
Apprentissage par Renforcement Profond Guidé par la Curiosité
Traitement du Langage Naturel à Partir des Principes Fondamentaux :
Fondamentaux de l'Apprentissage par Renforcement
Voici quelques livres / cours que je recommande (liens d'affiliation) :
Venez discuter sur Discord ici :
Besoin de tutorat personnalisé ? Aide sur un projet de programmation ? Envoyez-moi un e-mail ! phil@neuralnet.ai