Schnittstellen zwischen Regelung, Lernen und Optimierung 2020
"Sichere und effiziente Exploration im Reinforcement Learning"
Andreas Krause - ETH Zürich
Zusammenfassung: Im Zentrum des Reinforcement Learning steht die Herausforderung, Exploration – das Sammeln von Daten zur Verbesserung von Modellen – und Exploitation – die Nutzung der Schätzungen zur Entscheidungsfindung – abzuwägen. In simulierten Umgebungen (z.B. Spielen) ist Exploration hauptsächlich ein rechnerisches Anliegen. In realen Umgebungen ist Exploration kostspielig und potenziell gefährlich, da sie Experimente mit Aktionen erfordert, deren Konsequenzen unbekannt sind. In diesem Vortrag werde ich unsere Arbeiten vorstellen, die darauf abzielen, rigoros über die Sicherheit der Exploration im Reinforcement Learning nachzudenken. Ich werde einen modellfreien Ansatz diskutieren, bei dem wir versuchen, eine unbekannte Belohnungsfunktion unter unbekannten Einschränkungen zu optimieren. Sowohl Belohnung als auch Einschränkungen werden durch rauschbehaftete Experimente offenbart, und Sicherheit erfordert, dass zu keinem Zeitpunkt eine unzulässige Aktion gewählt wird. Ich werde auch modellbasierte Ansätze besprechen, bei denen wir durch Exploration über die Systemdynamik lernen, jedoch die Sicherheit der geschätzten Politik verifizieren müssen. Unsere Ansätze verwenden Bayessche Inferenz über das Ziel, die Einschränkungen und die Dynamik und sind – unter bestimmten Regularitätsbedingungen – sowohl sicher als auch vollständig, d.h. sie konvergieren zu einem natürlichen Begriff des erreichbaren Optimums. Ich werde auch aktuelle Ergebnisse präsentieren, die die Modellunsicherheit nutzen, um die Effizienz der Exploration zu verbessern, und Experimente zeigen, die sicheres und effizientes Tuning cyber-physikalischer Systeme auf datengestützte Weise demonstrieren.
Institut für reine und angewandte Mathematik, UCLA
26. Februar 2020