Interseções entre Controle, Aprendizado e Otimização 2020
"Exploração Segura e Eficiente em Aprendizado por Reforço"
Andreas Krause - ETH Zurich
Resumo: No cerne do Aprendizado por Reforço está o desafio de equilibrar exploração -- coletar dados para aprender melhores modelos -- e exploração -- usar a estimativa para tomar decisões. Em ambientes simulados (por exemplo, jogos), a exploração é principalmente uma preocupação computacional. Em cenários do mundo real, a exploração é custosa e uma proposta potencialmente perigosa, pois requer experimentar ações que têm consequências desconhecidas. Nesta palestra, apresentarei nosso trabalho em direção a uma análise rigorosa sobre a segurança da exploração em aprendizado por reforço. Discutirei uma abordagem sem modelo, onde buscamos otimizar uma função de recompensa desconhecida sujeita a restrições desconhecidas. Tanto a recompensa quanto as restrições são reveladas através de experimentos ruidosos, e a segurança exige que nenhuma ação inviável seja escolhida em nenhum momento. Também discutirei abordagens baseadas em modelo, onde aprendemos sobre a dinâmica do sistema através da exploração, mas precisamos verificar a segurança da política estimada. Nossas abordagens utilizam inferência bayesiana sobre o objetivo, restrições e dinâmicas, e -- sob algumas condições de regularidade -- estão garantidas para serem seguras e completas, ou seja, convergem para uma noção natural de ótimo alcançável. Também apresentarei resultados recentes aproveitando a incerteza do modelo para melhorar a eficiência da exploração e mostrarei experimentos sobre como ajustar sistemas ciberfísicos de maneira segura e eficiente, orientados por dados.
Instituto de Matemática Pura e Aplicada, UCLA
26 de fevereiro de 2020