Dieses Video vergleicht menschliche Teilnehmer in einem diskreten Markov-Entscheidungsprozess und künstliche Agenten. Die Agenten haben eine intrinsische Motivation, die auf Neuheit basiert, eine Lernrate, die durch Überraschung moduliert wird, sowie ein standardmäßiges belohnungsbasiertes Verstärkungslernmodul. Menschen lassen sich am besten durch einen komplexen Agenten erklären, der (nahezu) modellfrei ist, aber Neuheit zur Erkundung nutzt.