Intersections entre Contrôle, Apprentissage et Optimisation 2020
"Exploration Sûre et Efficace en Apprentissage par Renforcement"
Andreas Krause - ETH Zurich
Résumé : Au cœur de l'Apprentissage par Renforcement se trouve le défi de jongler entre l'exploration - collecter des données pour apprendre de meilleurs modèles - et l'exploitation - utiliser l'estimation pour prendre des décisions. Dans des environnements simulés (par exemple, des jeux), l'exploration est principalement une préoccupation computationnelle. Dans des contextes réels, l'exploration est coûteuse et potentiellement dangereuse, car elle nécessite d'expérimenter des actions dont les conséquences sont inconnues. Dans cette présentation, je vais présenter nos travaux visant à raisonner rigoureusement sur la sécurité de l'exploration en apprentissage par renforcement. Je discuterai d'une approche sans modèle, où nous cherchons à optimiser une fonction de récompense inconnue sous des contraintes inconnues. Tant la récompense que les contraintes sont révélées par des expériences bruitées, et la sécurité exige qu'aucune action non réalisable ne soit choisie à aucun moment. Je discuterai également des approches basées sur des modèles, où nous apprenons sur la dynamique du système à travers l'exploration, mais devons vérifier la sécurité de la politique estimée. Nos approches utilisent l'inférence bayésienne sur l'objectif, les contraintes et la dynamique, et - sous certaines conditions de régularité - sont garanties d'être à la fois sûres et complètes, c'est-à-dire de converger vers une notion naturelle d'optimum atteignable. Je présenterai également des résultats récents exploitant l'incertitude du modèle pour améliorer l'efficacité de l'exploration, et montrerai des expériences sur l'ajustement sûr et efficace de systèmes cyber-physiques de manière axée sur les données.
Institut de Mathématiques Pures et Appliquées, UCLA
26 février 2020