O aprendizado por reforço é um campo da aprendizagem de máquina que se preocupa com como um agente deve tomar ações de forma mais otimizada em um ambiente. Acredito que este campo de estudo será muito importante nas próximas décadas, então aqui estou tentando tornar o conhecimento mais acessível.
Recursos:
Artigos:
Algoritmos/artigos interessantes:
00:00 - Introdução
04:27 - Processos de Decisão de Markov
16:37 - Exemplo de Grade + Monte Carlo
36:22 - Diferença Temporal
50:54 - Redes Q Profundas
58:45 - Gradientes de Política
1:12:06 - Neurociência
1:20:24 - Limitações & Direções Futuras
1:31:57 - Conclusão