Sieh dir an, wie eine KI lernt, zu erkunden und die beste Belohnung zu finden.
In diesem Video betreten wir eine einfache Gitterwelt, in der ein Agent durch Tunnel navigiert, um nach Schätzen zu suchen. Es gibt zwei Optionen: eine kleine Belohnung in der Nähe des Startpunkts und eine größere Belohnung, die einen längeren und unsicheren Weg erfordert.
Zunächst entscheidet sich der Agent oft für den einfachen Gewinn. Dies führt zu einer suboptimalen Lösung, bei der er wiederholt den kleineren Schatz wählt, anstatt den besseren zu entdecken. Die zentrale Herausforderung ist die Erkundung.
Durch intuitive Animationen zeigen wir, wie der Agent versucht, neue Wege auszuprobieren und gleichzeitig das, was er bereits weiß, zu nutzen. Gleichzeitig wird das interne Gedächtnis des Agents visualisiert und entwickelt sich Schritt für Schritt weiter. Du wirst sehen, wie sich seine gelernten Werte ändern, während er Erfahrung sammelt, und wie dieses Gedächtnis ihn schließlich zur besseren Wahl führt.
📺 Dieses Video ist Teil der Serie:
Verstärkendes Lernen erklärt – Animierte Beispiele
Theorie ist in dieser Version ausgeschlossen.