#aprendizadoPorReforço #inteligênciaArtificial
No módulo 3, vamos abordar um problema fundamental no aprendizado por reforço: o dilema explorar-explorar.
Os agentes inteligentes devem equilibrar seu desejo por recompensas de curto prazo com a perspectiva de alcançar recompensas maiores a longo prazo. Exploramos algumas estratégias diferentes para resolver esse dilema: valores iniciais otimistas, epsilon-guloso e aprendizado off-policy.
No módulo 4, vamos aplicar tudo isso ao contexto de resolução de problemas com programação dinâmica, então fique ligado.
Aprenda como transformar artigos de aprendizado profundo por reforço em código:
Obtenha acesso instantâneo a todos os meus cursos, incluindo o novo curso de Replay de Experiência Priorizada, com meu serviço de assinatura. $29 por mês lhe dá acesso instantâneo a 42 horas de conteúdo instrucional, além de acesso a atualizações futuras, adicionadas mensalmente.
Descontos disponíveis para alunos da Udemy (matriculados há mais de 30 dias). Basta enviar um e-mail para sales@neuralnet.ai
Ou, adquira meus cursos da Udemy aqui:
Deep Q Learning:
Métodos Actor-Critic:
Aprendizado por Reforço Profundo Orientado pela Curiosidade
Processamento de Linguagem Natural a partir dos Princípios Fundamentais:
Fundamentos do Aprendizado por Reforço
Aqui estão alguns livros / cursos que recomendo (links de afiliados):
Venha conversar no Discord aqui:
Precisa de tutoria personalizada? Ajuda em um projeto de programação? Envie-me um e-mail! phil@neuralnet.ai