#aprendizajeporrefuerzo #inteligenciaartificial
En el módulo 3 vamos a abordar un problema fundamental en el aprendizaje por refuerzo: el dilema explorar-explotar.
Los agentes inteligentes deben equilibrar su deseo de recompensa a corto plazo con la perspectiva de lograr recompensas mayores a largo plazo. Exploramos algunas estrategias diferentes para resolver este dilema: valores iniciales optimistas, epsilon-greedy y aprendizaje fuera de política.
En el módulo 4, aplicaremos todo esto al contexto de resolver problemas con programación dinámica, así que mantente atento.
Aprende a convertir artículos de aprendizaje profundo por refuerzo en código:
Obtén acceso instantáneo a todos mis cursos, incluido el nuevo curso de Prioritized Experience Replay, con mi servicio de suscripción. $29 al mes te da acceso instantáneo a 42 horas de contenido instructivo más acceso a futuras actualizaciones, añadidas mensualmente.
Descuentos disponibles para estudiantes de Udemy (inscritos por más de 30 días). Solo envía un correo a sales@neuralnet.ai
O, adquiere mis cursos de Udemy aquí:
Deep Q Learning:
Métodos Actor-Crítico:
Aprendizaje por Refuerzo Profundo Impulsado por Curiosidad
Procesamiento de Lenguaje Natural desde los Primeros Principios:
Fundamentos del Aprendizaje por Refuerzo
Aquí hay algunos libros / cursos que recomiendo (enlaces de afiliado):
Ven a charlar en Discord aquí:
¿Necesitas tutoría personalizada? ¿Ayuda en un proyecto de programación? ¡Envíame un correo! phil@neuralnet.ai