Gierige Strategie vs ε-gierige Strategie
Das Ziel der Aufgabe im Reinforcement Learning ist es, eine optimale Strategie zu lernen. Eine Strategie ist die Vorgehensweise, die der Agent wählt, um eine Aktion basierend auf dem Zustand des Agenten in der Umgebung auszuführen. Die optimale Strategie ist diejenige, die den erwarteten Gesamtwert der Belohnung maximiert.
Im modellfreien Reinforcement Learning kennen wir das Modell der Umgebung nicht. Das bedeutet, dass wir nicht alle Zustände, alle verfügbaren Aktionen in allen Zuständen, die Übergangswahrscheinlichkeitsfunktion und die Belohnungsfunktion kennen. Wir lernen über all diese Elemente, während wir das Spiel spielen. Wir erfahren immer mehr über diese Elemente, während wir das Spiel spielen.
Zu Beginn des Spiels kennen wir die Belohnungen und die resultierenden Zustände für die in einem bestimmten Zustand verfügbaren Aktionen nicht. Das heißt, wir haben nur teilweise Kenntnisse über die Umgebung. Aufgrund dieses teilweisen Wissens über die Umgebung steht unser Agent vor dem Explorations-Exploitation-Dilemma.
Exploitation: Die besten Aktionen basierend auf begrenztem Wissen über Belohnungen für eine kleine Anzahl von Aktionen ausführen.
Exploration: Neue Aktionen erkunden, die der Agent noch nicht ausprobiert hat, aber der Agent hat keine Ahnung, welche Belohnungen er für die Ausführung solcher Aktionen erhalten wird.
Gierige Strategie
In jedem gegebenen Lernstadium, wenn der Agent die beste Aktion basierend auf den verfügbaren Informationen auswählt, wird eine solche Strategie als gierige Strategie bezeichnet.
Eine solche Strategie mag kurzfristig vorteilhaft erscheinen, aber wir könnten größere Belohnungen bei unerforschten Aktionen verpassen.
Wenn der Agent nur die beste Aktion basierend auf teilweisen Informationen auswählt, könnte er potenziell größere Belohnungen in der Zukunft verpassen, die mit früheren, weniger belohnenden Aktionen verbunden sind.
ε
ε-gierige Strategie
Die ε-gierige Strategie ist eine sehr einfache Strategie zur Auswahl von Aktionen unter Verwendung der aktuellen Q-Wert-Schätzungen. Sie funktioniert wie folgt:
Mit einer Wahrscheinlichkeit von (1- ε) wähle die Aktion mit dem höchsten Q-Wert.
Mit einer Wahrscheinlichkeit von (ε) wähle eine beliebige Aktion zufällig.