Neste vídeo, vamos aprender sobre dois ótimos métodos de RL para exploração auto-supervisionada - Curiosidade e Random Network Distillation (RND). Usaremos um algoritmo de RL on-policy popular (A2C ou Advantage Actor-Critic) para explorar este espaço fascinante. Ao longo do caminho, aprenderemos alguns exemplos de código em Python e Pytorch, e estudaremos por que exatamente esses métodos funcionam e os vários desafios que eles resolvem. Curiosidade ensina os agentes a explorar estados que eles consideram os menos previsíveis, e RND ensina os agentes a explorar estados que são os mais "novos". As arquiteturas de rede neural por trás dos dois são incrivelmente simples, mas geniais, e evitam soluções barulhentas de hacking de recompensa para uma abordagem de recompensa intrínseca mais simplificada.
#aprendizadoPorReforço #ia #aprendizadoProfundo
Membros têm acesso a TUDO nos bastidores que vai para a produção dos meus vídeos. Além disso, isso apoia o canal de uma grande maneira e ajuda a pagar minhas contas.
Artigos: