Assista como uma IA aprende a explorar e encontrar a melhor recompensa.
Neste vídeo, entramos em um simples mundo em grade onde um agente navega por túneis em busca de tesouro. Existem duas opções: uma pequena recompensa perto do ponto de partida e uma recompensa maior que requer um caminho mais longo e incerto.
No início, o agente frequentemente se contenta com a vitória fácil. Isso leva a uma solução subótima, onde ele escolhe repetidamente o tesouro menor em vez de descobrir o melhor. O grande desafio é a exploração.
Através de animações intuitivas, mostramos como o agente equilibra a tentativa de novos caminhos com o uso do que já sabe. Ao mesmo tempo, a memória interna do agente é visualizada e evolui passo a passo. Você verá como seus valores aprendidos mudam à medida que ganha experiência e como essa memória eventualmente o guia em direção à melhor escolha.
📺 Este vídeo faz parte da série:
Aprendizado por Reforço Explicado – Exemplos Animados
A teoria está excluída nesta versão