Web Scraping for Data Analysis in Python (Parte V): Enriquecimiento de datos
En el artículo anterior conseguimos información espacial de cada uno de los items, algo que ya adelantamos que nos abriría muchas posibilidades en el futuro. En este artículo haremos uso de dicha información para cruzarla con otras fuentes de datos y así obtener información más relevante.
Web Scraping for Data Analysis in Python (Parte IV): Geoencoding
En el artículo anterior obtuvimos todos los datos estructurados que el portal web nos podía ofrecer. No obstante, podemos ir mucho (mucho) más allá aprovechando el resto de la web como fuente de datos. Una de las características más importantes que podemos desear conocer es la posición espacial que ocupa el item. Conocer las coordenadas exactas (o aproximadas) de un dato nos abre la puerta a un océano de datos espaciales con los que cruzar nuestros datos.
Web Scraping for Data Analysis in Python (Parte III): Scrapping
En el artículo anterior descargamos una copia local de todas las páginas que contenían información relevante para nosotros. Esto nos va a permitir trabajar con libertad a partir de este momento ya que no necesitaremos volver a acceder al portal. En otras palabras, podemos trabajar completamente offline.
Web Scraping for Data Analysis in Python (Parte II): Protección contra crawlers
Tal y como se mencionó en la introducción, algunos sitios web establecen medidas de seguridad para evitar el acceso de crawlers. Tales medidas pueden abarcar desde una simple comprobación del User-Agent hasta un sofisticado sistema de registros y heurísticas que tratan de detectar a estos autómatas.