Intersecciones entre Control, Aprendizaje y Optimización 2020
"Exploración Segura y Eficiente en Aprendizaje por Refuerzo"
Andreas Krause - ETH Zurich
Resumen: En el corazón del Aprendizaje por Refuerzo se encuentra el desafío de equilibrar la exploración -- recolectar datos para aprender mejores modelos -- y la explotación -- utilizar la estimación para tomar decisiones. En entornos simulados (por ejemplo, juegos), la exploración es principalmente una preocupación computacional. En entornos del mundo real, la exploración es costosa y puede ser una proposición peligrosa, ya que requiere experimentar con acciones que tienen consecuencias desconocidas. En esta charla, presentaré nuestro trabajo hacia un razonamiento riguroso sobre la seguridad de la exploración en el aprendizaje por refuerzo. Discutiré un enfoque sin modelo, donde buscamos optimizar una función de recompensa desconocida sujeta a restricciones desconocidas. Tanto la recompensa como las restricciones se revelan a través de experimentos ruidosos, y la seguridad requiere que no se elija ninguna acción inviable en ningún momento. También discutiré enfoques basados en modelos, donde aprendemos sobre la dinámica del sistema a través de la exploración, pero necesitamos verificar la seguridad de la política estimada. Nuestros enfoques utilizan inferencia bayesiana sobre el objetivo, las restricciones y la dinámica, y -- bajo ciertas condiciones de regularidad -- se garantiza que sean tanto seguros como completos, es decir, que converjan a una noción natural de óptimo alcanzable. También presentaré resultados recientes que aprovechan la incertidumbre del modelo para mejorar la eficiencia de la exploración y mostraré experimentos sobre la sintonización segura y eficiente de sistemas ciberfísicos de manera impulsada por datos.
Instituto de Matemáticas Puras y Aplicadas, UCLA
26 de febrero de 2020