Diese Vorlesung führt in das Verstärkende Lernen (RL) ein, den Bereich des maschinellen Lernens, in dem ein Agent lernt, sequenzielle Entscheidungen durch Interaktion mit einer Umgebung zu treffen. Wir beginnen mit dem grundlegenden Agent-Umgebung-Zyklus – Zustände, Aktionen, Belohnungen und Beobachtungen – und formalisieren ihn als Markov-Entscheidungsprozess, wobei wir den Rückfluss, den Abzinsungsfaktor sowie die Wert- und Aktionswertfunktionen (Q) einführen, die quantifizieren, wie gut Zustände und Aktionen sind. Das Video erklärt die grundlegende Spannung zwischen Exploration und Ausbeutung und wie Algorithmen optimale Politiken durch Erfahrung lernen. Wir bauen von tabellarischem Q-Learning und dem Bellman-Update zu Deep Q-Networks (DQN) auf und behandeln wichtige Ingenieurideen wie Erfahrungsspeicherung und Zielnetzwerke, die das Lernen stabilisieren, sowie epsilon-gierige Exploration. Anschließend kontrastieren wir wertbasierte Methoden mit Policy-Gradient- und Actor-Critic-Ansätzen für kontinuierliche und stochastische Steuerung. Dabei verankern wir diese Konzepte in wegweisenden Demonstrationen – robotische Manipulation mit OpenAI's Dactyl, das Meistern von Atari-Spielen mit Agent57, übermenschliches Spielen in Go mit AlphaGo und die Vorhersage von Proteinstrukturen mit AlphaFold – und betonen sicheres Erkunden und Belohnungsdesign. Schließlich verbinden wir RL mit realen globalen Gesundheitslogistik, einschließlich Optimierung der Lieferkette, Ressourcenallokation und Entscheidungsfindung unter Unsicherheit in ressourcenlimitierten Umgebungen.
#KI im Gesundheitswesen, #maschinelles Lernen in der Medizin, #Deep Learning im Gesundheitswesen, #verstärkendes Lernen, #Deep Reinforcement Learning, #Q-Learning, #DQN, #Policy-Gradienten, #AlphaGo, #AlphaFold, #medizinische KI, #Gesundheitstechnologie, #Healthtech, #KI-Kurs Medizin, #KI-Vorlesung, #KI-Ausbildung Gesundheitswesen, #globale Gesundheits-KI, #KI für Ärzte, #KI und maschinelles Lernen erklärt, #KI medizinische Zukunft