Comment analyser response.text depuis Scrapy, (ou requests, ou Beautiful Soup).
(Pas besoin d'expressions régulières, juste split, strip, replace).
Si vous constatez que vous essayez de scraper des commentaires d'une page, et qu'ils sont à l'intérieur de javascript, vous aurez besoin d'une autre méthode pour obtenir les valeurs/textes. CSS ou XPATH ne vous aideront pas.
Ici, je montre comment analyser le javascript pour extraire le JSON, puis charger le JSON dans un dictionnaire. Une fois que les clés et valeurs sont là, vous pouvez travailler avec très facilement.
◉ 1:26 recherche de JSON
◉ 2:19 voir la source
◉ 2:55 trouvé JSON.parse
◉ 4:45 trouvé des commentaires à l'intérieur du JSON
◉ 5:29 print(response.text)
◉ 6:09 x = response.text.split('JSON.parse')[2].replace("\\u0022","\"").lstrip("\(").split(" ")[0].replace("}\");","\"").replace("\"{","\""})
◉ 8:43 json.loads
◉ 12:27 sortie finale
RTFM 📙 :
Merci de regarder.
À bientôt, d'accord ?
Dr P.