Esta clase introduce el Aprendizaje por Refuerzo (RL), la rama del aprendizaje automático donde un agente aprende a tomar decisiones secuenciales interactuando con un entorno. Comenzamos con el bucle fundamental agente-entorno: estados, acciones, recompensas y observaciones, y lo formalizamos como un Proceso de Decisión de Markov, introduciendo el retorno, el factor de descuento y las funciones de valor y valor de acción (Q) que cuantifican cuán buenos son los estados y las acciones. El video explica la tensión fundamental entre exploración y explotación, y cómo los algoritmos aprenden políticas óptimas a través de la experiencia. Partimos del Q-learning tabular y la actualización de Bellman hacia las Redes Neuronales Profundas Q (DQN), cubriendo ideas clave de ingeniería como la repetición de experiencias y las redes objetivo que estabilizan el aprendizaje, junto con la exploración epsilon-greedy. Luego contrastamos los métodos basados en valor con los enfoques de gradiente de política y actor-crítico para el control continuo y estocástico. A lo largo de la clase, fundamentamos estos conceptos en demostraciones emblemáticas: manipulación robótica con Dactyl de OpenAI, dominando juegos de Atari con Agent57, juego sobrehumano en Go con AlphaGo, y predicción de estructuras de proteínas con AlphaFold, mientras enfatizamos la exploración segura y el diseño de recompensas. Finalmente, conectamos el RL con la logística de salud global en el mundo real, incluyendo la optimización de la cadena de suministro, la asignación de recursos y la toma de decisiones bajo incertidumbre en entornos con recursos limitados.
#IA en salud, #aprendizaje automático en medicina, #aprendizaje profundo en salud, #aprendizaje por refuerzo, #aprendizaje profundo por refuerzo, #Q-learning, #DQN, #gradientes de política, #AlphaGo, #AlphaFold, #IA médica, #tecnología en salud, #healthtech, #curso de IA en medicina, #clase de IA, #educación en IA en salud, #IA en salud global, #IA para médicos, #IA y aprendizaje automático explicados, #futuro médico de la IA