En este video, aprenderemos sobre dos grandes métodos de RL para la exploración auto supervisada: Curiosidad y Destilación de Redes Aleatorias (RND). Usaremos un algoritmo de RL popular en política (A2C o Actor-Crítico con Ventaja) para explorar este fascinante espacio. A lo largo del camino, aprenderemos algunos ejemplos de código en Python y Pytorch, y estudiaremos por qué exactamente estos métodos funcionan y los diversos desafíos que resuelven. La Curiosidad enseña a los agentes a explorar estados que consideran los menos predecibles, y RND enseña a los agentes a explorar estados que son los más "novedosos". Las arquitecturas de redes neuronales detrás de los dos son increíblemente simples pero geniales, y evitan soluciones ruidosas de hacking de recompensas para un enfoque de recompensa intrínseca más fluido.
#aprendizajeporrefuerzo #ia #aprendizajprofundo
Los miembros obtienen acceso a TODO lo que hay detrás de cámaras que se necesita para producir mis videos. Además, apoya el canal de gran manera y ayuda a pagar mis cuentas.
Artículos: