In diesem Video lernen wir zwei großartige RL-Methoden für selbstüberwachtes Erkunden kennen - Neugier und Random Network Distillation (RND). Wir verwenden einen beliebten On-Policy-RL-Algorithmus (A2C oder Advantage Actor-Critic), um diesen faszinierenden Bereich zu erkunden. Unterwegs lernen wir einige Codebeispiele in Python und Pytorch und untersuchen, warum genau diese Methoden funktionieren und welche verschiedenen Herausforderungen sie lösen. Neugier lehrt Agenten, Zustände zu erkunden, die sie als am wenigsten vorhersagbar empfinden, und RND lehrt Agenten, Zustände zu erkunden, die am "neuartigsten" sind. Die neuronalen Netzwerkarchitekturen hinter den beiden sind unglaublich einfach, aber genial, und sie vermeiden rauschende Belohnungshacking-Lösungen zugunsten eines effizienteren intrinsischen Belohnungsansatzes.
#reinforcementlearning #ai #deeplearning
Mitglieder erhalten Zugang zu ALLEM hinter den Kulissen, was in die Produktion meiner Videos fließt. Außerdem unterstützt es den Kanal erheblich und hilft, meine Rechnungen zu bezahlen.
Papiere: