Extracción web

Frameworks y herramientas para rastrear sitios web, navegación headless y extracción de datos.

Repositorios

Biblioteca Node.js de automatización de navegadores que controla Chrome y Firefox mediante DevTools Protocol o WebDriver BiDi. Funciona en modo headless por defecto, ideal para web scraping, testing automatizado, capturas de pantalla, generación de PDF y flujos de automatización.

TypeScript
95.5k
8 hours ago

Rastreador web de código abierto optimizado para LLM, convierte contenido web en Markdown limpio para aplicaciones de IA. Incluye procesamiento asíncrono, automatización de navegadores y extracción de datos estructurados.

Python
80.6k
7 hours ago
D4Vinci/Scrapling

Scrapling es un framework adaptativo de web scraping en Python que maneja desde solicitudes únicas hasta rastreo a gran escala. Su parser inteligente reubica elementos automáticamente tras cambios en el sitio, los fetchers integrados evaden sistemas anti-bot como Cloudflare, y el framework de spiders soporta rastreo concurrente con pausa/reanudación, rotación de proxies e integración de IA mediante servidor MCP.

Python
77.4k
6 days ago

Crawler multiplataforma de redes sociales compatible con Xiaohongshu, Douyin, Kuaishou, Bilibili, Weibo, Tieba y Zhihu. Basado en Playwright con modo CDP, ofrece búsqueda por palabras clave, extracción de publicaciones y comentarios anidados, perfil de creadores, pool de proxies IP, caché de sesión, nube de palabras de comentarios, WebUI visual y múltiples formatos de almacenamiento como CSV, JSON, Excel, SQLite y MySQL.

Python
64.2k
18 days ago
scrapy/scrapy

Scrapy es un potente framework de Python para web crawling y scraping, que proporciona un conjunto completo de herramientas para extraer datos estructurados de sitios web de manera eficiente y a gran escala.

Python
64.1k
3 days ago

The fast, flexible, and elegant library for parsing and manipulating HTML and XML.

TypeScript
30.5k
4 days ago

Elegant Scraper and Crawler Framework for Golang

Go
25.5k
17 days ago

⬛️ CLI tool and library for saving complete web pages as a single HTML file

Rust
15.4k
3 months ago