Política Codiciosa vs Política ε-Codiciosa
El objetivo de la tarea de aprendizaje por refuerzo es aprender una política óptima. La política es la estrategia seguida por el agente para tomar una acción dada el estado del agente en el entorno. La política óptima es aquella que maximiza el valor esperado de la recompensa total.
En el aprendizaje por refuerzo sin modelo, no conocemos el modelo del entorno. Es decir, no conocemos todos los estados, todas las acciones disponibles en todos los estados, la función de probabilidad de transición y la función de recompensa. Aprendemos sobre todos los elementos a medida que jugamos el juego. Aprendemos más y más sobre estos elementos a medida que jugamos.
Al principio del juego, no conocemos las recompensas y los estados resultantes para las acciones disponibles en un estado dado. Es decir, tenemos un conocimiento parcial del entorno. Debido a este conocimiento parcial del entorno, nuestro agente enfrenta el dilema de exploración y explotación.
Explotación: tomar las mejores acciones basadas en el conocimiento limitado de las recompensas para un pequeño número de acciones.
Exploración: explorar las nuevas acciones que el agente no ha probado, pero el agente no tiene idea de qué recompensas recibirá por tomar tal acción.
Política Codiciosa
En cualquier etapa del aprendizaje, si el agente toma la mejor acción basada en la información disponible, entonces tal política se llama política codiciosa.
Tal política puede parecer ventajosa a corto plazo, pero podemos perder recompensas mayores en acciones no exploradas.
Si el agente toma solo la mejor acción basada en información parcial, puede perderse recompensas potencialmente mayores en el futuro que están asociadas con tomar acciones anteriores que son menos gratificantes.
ε
Política ε-Codiciosa
La política ε-codiciosa es una política muy simple de elegir acciones utilizando las estimaciones actuales del valor Q. Funciona de la siguiente manera:
Con probabilidad (1- ε) elige la acción que tiene el mayor valor Q.
Con probabilidad (ε) elige cualquier acción al azar.