Este vídeo compara participantes humanos em um Processo de Decisão de Markov discreto e agentes artificiais. Os agentes têm motivação intrínseca baseada na novidade, uma taxa de aprendizado que é modulada pela surpresa, além de um módulo padrão de aprendizado por reforço baseado em recompensas. Os humanos são melhor explicados por um agente complexo que é (quase) livre de modelo, mas utiliza a novidade para exploração.