Verstärkendes Lernen: Agenteninteraktion, Belohnungen und das Gleichgewicht zwischen Exploration und Exploitation | Knoovi