Cette vidéo compare des participants humains dans un processus de décision Markov discret et des agents artificiels. Les agents ont une motivation intrinsèque basée sur la nouveauté, un taux d'apprentissage modulé par la surprise, ainsi qu'un module standard d'apprentissage par renforcement basé sur les récompenses. Les humains sont mieux expliqués par un agent complexe qui est (presque) sans modèle, mais utilise la nouveauté pour l'exploration.