Erforschung von Strategien im Reinforcement Learning: Zufällige Exploration im Multi-Armed Bandit Kap. 3 | Knoovi