Política Gananciosa vs Política ε-Gananciosa
O objetivo da tarefa de aprendizado por reforço é aprender uma política ótima. Política é a estratégia seguida pelo agente para tomar uma ação dada a situação do agente no ambiente. A política ótima é aquela que maximiza o valor esperado da recompensa total.
No aprendizado por reforço sem modelo, não conhecemos o modelo do ambiente. Ou seja, não sabemos todos os estados, todas as ações disponíveis em todos os estados, a função de probabilidade de transição e a função de recompensa. Aprendemos sobre todos os elementos à medida que jogamos o jogo. Aprendemos cada vez mais sobre esses elementos à medida que jogamos.
No início do jogo, não sabemos as recompensas e os estados resultantes para as ações disponíveis em um determinado estado. Ou seja, temos conhecimento parcial do ambiente. Por causa desse conhecimento parcial do ambiente, nosso agente enfrenta o dilema de exploração e exploração.
Exploração: tomar as melhores ações com base no conhecimento limitado das recompensas para um pequeno número de ações.
Exploração: explorar novas ações que o agente não tentou, mas o agente não tem ideia sobre quais recompensas receberá ao tomar tal ação.
Política Gananciosa
Em qualquer estágio do aprendizado, se o agente toma a melhor ação com base nas informações disponíveis, essa política é chamada de política gananciosa.
Essa política pode parecer vantajosa a curto prazo, mas podemos perder recompensas maiores em ações não exploradas.
Se o agente toma apenas a melhor ação com base em informações parciais, ele pode perder recompensas potencialmente maiores no futuro que estão associadas a ações anteriores que são menos recompensadoras.
Política ε-Gananciosa
A política ε-gananciosa é uma política muito simples de escolha de ações usando as estimativas atuais de Q-value. Funciona da seguinte forma:
Com probabilidade (1- ε) escolha a ação que tem o maior Q-value.
Com probabilidade (ε) escolha qualquer ação aleatoriamente.