Politique avide vs Politique ε-avide
L'objectif de la tâche d'apprentissage par renforcement est d'apprendre une politique optimale. La politique est la stratégie suivie par l'agent pour prendre une action donnée l'état de l'agent dans l'environnement. La politique optimale est celle qui maximise la valeur attendue de la récompense totale.
Dans l'apprentissage par renforcement sans modèle, nous ne connaissons pas le modèle de l'environnement. C'est-à-dire que nous ne connaissons pas tous les états, toutes les actions disponibles dans tous les états, la fonction de probabilité de transition et la fonction de récompense. Nous apprenons sur tous les éléments au fur et à mesure que nous jouons au jeu. Nous en apprenons de plus en plus sur ces éléments au fur et à mesure que nous jouons au jeu.
Au début du jeu, nous ne connaissons pas les récompenses et les états résultants pour les actions disponibles dans un état donné. C'est-à-dire que nous avons une connaissance partielle de l'environnement. En raison de cette connaissance partielle de l'environnement, notre agent est confronté au dilemme d'exploration-exploitation.
Exploitation : prendre les meilleures actions sur la base d'une connaissance limitée des récompenses pour un petit nombre d'actions.
Exploration : Explorer les nouvelles actions que l'agent n'a pas essayées, mais l'agent n'a aucune idée des récompenses qu'il recevra pour avoir pris une telle action.
Politique avide
À tout moment de l'apprentissage, si l'agent prend la meilleure action sur la base des informations disponibles, alors une telle politique est appelée politique avide.
Une telle politique peut sembler avantageuse à court terme, mais nous pouvons manquer de plus grandes récompenses dans les actions inexplorées.
Si l'agent ne prend que la meilleure action sur la base d'informations partielles, alors il peut manquer des récompenses potentiellement plus importantes à l'avenir qui sont associées à des actions antérieures moins gratifiantes.
ε
Politique ε-avide
La politique ε-avide est une politique très simple de choix d'actions utilisant les estimations actuelles des valeurs Q. Elle se déroule comme suit :
Avec une probabilité (1- ε), choisissez l'action qui a la valeur Q la plus élevée.
Avec une probabilité (ε), choisissez une action au hasard.