Explorando Estratégias de Aprendizado por Reforço: Exploração Aleatória em Multi-Armed Bandit Ch. 3 | Knoovi