{"repo":"devsebastian44/Web-Scraping","free":true,"listed":false,"github":"https://github.com/devsebastian44/Web-Scraping","clone":"git clone https://github.com/devsebastian44/Web-Scraping.git","description":"Script para extracción de datos y URLs de páginas web","language":"Python","stars":10,"topics":["python","python3","web-scraping","website","analisis-de-datos","data-science"],"license":"MIT","category":"scrapers-browser-automation","readme_excerpt":"🕷️ Web Scraping — Extractor de Datos y URLs Herramienta de extracción automatizada de datos y recursos desde páginas web estáticas, desarrollada en Python. Permite auditar activos web, recolectar enlaces y procesar el contenido HTML de cualquier sitio objetivo de forma estructurada y reproducible. --- 🧠 Overview Este proyecto implementa un pipeline de web scraping orientado a la recolección de datos públicos desde páginas web. A partir de una URL objetivo, el script realiza peticiones HTTP, parsea el árbol HTML resultante y extrae elementos de interés como hipervínculos, recursos embebidos (JS, CSS) y texto estructurado. El proyecto está pensado como base modular para tareas de análisis de datos web , auditoría de activos y construcción de datasets , siguiendo buenas prácticas de organización de código con separación clara entre fuentes, documentación y diagramas. --- ⚙️ Features - 🌐 Peticiones HTTP controladas — Envío de solicitudes GET con manejo de respuestas y códigos de estado HTTP - 🧩 Parseo HTML estructurado — Navegación del árbol DOM mediante BeautifulSoup4 para extracción precisa de elementos - 🔗 Recolección de URLs — Extracción de todos los hipervínculos ( ) presentes en la página objetivo - 📦 Auditoría de activos — Detección de recursos embebidos: archivos .js , .css e imágenes referenciadas - 💾 Almacenamiento local de resultados — Los datos extraídos se guardan en el directorio data/ (excluido del repositorio) - 📐 Diagramas de arquitectura — Carpeta diagra","default_branch":null,"files":null,"tree":[],"storefront":"/r/devsebastian44","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/devsebastian44/Web-Scraping/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}