Este video compara a participantes humanos en un Proceso de Decisión de Markov discreto y agentes artificiales. Los agentes tienen motivación intrínseca basada en la novedad, una tasa de aprendizaje que se modula por la sorpresa, así como un módulo estándar de aprendizaje por refuerzo basado en recompensas. Los humanos se explican mejor mediante un agente complejo que es (casi) libre de modelo, pero utiliza la novedad para la exploración.