#scrapy #webscraping #python
Código de Scrapy + Python para extraer datos disponibles públicamente de listados de propiedades.
Originalmente basado en el video de Bienes Raíces de Bahréin de CMK, decidimos explorar una forma diferente de escribir el código para lograr la misma salida y aquí está el resultado!
▸El código comienza en 10:20
**disculpas por 30 segundos justo antes de eso donde el texto está fuera de la pantalla..¡mi culpa!
▸ Público objetivo: Usuarios de Scrapy de nivel Principiante a Intermedio
▸ Puramente para demostrar xpath, hemos escrito todos los selectores para usar xpath
▸ Se ha utilizado ItemLoader con el archivo items.py para permitir el uso de procesadores de entrada y salida
▸ También se ha utilizado add_value, junto con add_xpath para llenar los campos de scrapy
▸ Mira para ver la escritura del código, la corrección de algunos errores tipográficos y el éxito con la salida final deseada en formato csv.
Este formato de código se puede modificar para ser utilizado en otros sitios - y la ventaja de usar ItemLoader es que si tuvieras otra araña similar para escribir, podrías acceder a los mismos campos en items.py si eliges importar ese mismo módulo.
Este código no está destinado a ser "mejor" que el original escrito por Maksim, hay ventajas en su código, es decir, solo un archivo, todo contenido en uno. Solo hemos buscado ilustrar el uso de selectores xpath, ItemLoader y Procesadores de Entrada/Salida como una forma alternativa de hacer scraping en un sitio de bienes raíces.
También hay otros pequeños consejos en el video, como editar el archivo de configuración, para permitirte trabajar con la consola de Scrapy cuando muestra 'prohibido'.
Créditos: Gracias a Maskim Korzh por el código original que me dio la idea.
Créditos: Ahmed Rafik Djerah por los siguientes ejemplos de código:
-- usar xpaths en lugar de css, -- ItemLoader -- nuevo "next_page"
Espero que aprendas/disfrutes.
Por favor, comenta.
¡Nos vemos por ahí, sí!
Dr Pi
Aún nadie me ha comprado un maldito café/té.