Coder son propre crawler est presque un rite de passage pour utiliser Python dans le SEO, mais la gestion des tâches est l'une des choses les plus difficiles à conceptualiser et à mettre en œuvre. Dans cette vidéo, je crée une liste d'URLs non visitées et visitées en utilisant la sérialisation, en mettant à jour l'objet sérialisé dans le stockage à chaque lecture et écriture afin que même si le (petit) crawl est interrompu, il puisse reprendre là où il s'était arrêté. Je n'ai pas encore implémenté la capacité de reprise, mais je suis prêt pour cela.