web-scraping
Repositorios de código abierto monitorizados etiquetados con web-scraping, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a web-scraping en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con web-scraping.
- #1
Monitorización, recopilación y transferencia de contenido multiplataforma. Un panel web para gestionar Douyin, Xiaohongshu y Kuaishou.
★ 1781 - #2
El mejor navegador headless para agentes de IA. Ligero, rápido y de alta compatibilidad. Construido en Rust
★ 1481 - #3
Motor de scraping autohospedado: evita cualquier desafío de JS y captcha: Cloudflare, Turnstile, reCAPTCHA, hCaptcha, GeeTest. Alternativa y reemplazo directo para FlareSolverr y Byparr en tu stack *arr.
★ 742 - #4
A skill for AI agents: search the web with SearXNG, browse with Camofox, bypass protections with CloakBrowser. Anti-hallucination by design. Self-hosted, free, unlimited.
★ 506 - #5
Turn any website into a compact CLI tailored for AI agents. Browse the web in hundreds of tokens, not tens of thousands.
★ 412
- #1
La API de contexto para buscar, extraer e interactuar con la web a gran escala. 🔥
★ 174.034+3406Variación de estrellas de los últimos 7 días - #2
🕷️ ¡Un framework de Web Scraping adaptativo que maneja todo, desde una sola solicitud hasta un rastreo a gran escala!
★ 77.158+1432Variación de estrellas de los últimos 7 días - #3
Scrapy, un marco de trabajo rápido y de alto nivel para rastreo y extracción web en Python.
★ 64.098+106Variación de estrellas de los últimos 7 días - #4
La mejor y más simple herramienta para la detección de cambios en sitios web, monitoreo de páginas web y alertas de cambios. ¡Perfecto para rastrear cambios de contenido, bajadas de precio, alertas de reabastecimiento y monitoreo de desfiguración web, todo gratis o disfruta de nuestro plan SaaS!
★ 33.414+132Variación de estrellas de los últimos 7 días - #5
Clona cualquier sitio web con un solo comando usando agentes de codificación de IA
★ 33.352+683Variación de estrellas de los últimos 7 días - #6
Chromium sigiloso que supera todas las pruebas de detección de bots. Reemplazo directo de Playwright con parches de huellas digitales a nivel de código fuente. 30/30 pruebas superadas.
★ 30.947+439Variación de estrellas de los últimos 7 días - #7
Bot de código abierto en Python para postularse a empleos con IA: automatización del navegador y web scraping para leer ofertas de empleo, y luego postulación automática con un currículum y carta de presentación personalizados para cada oferta.
★ 30.278+58Variación de estrellas de los últimos 7 días - #8
Scraper de Python basado en IA
★ 30.047+244Variación de estrellas de los últimos 7 días - #9
Crawlee: una biblioteca de web scraping y automatización de navegadores para Node.js para crear rastreadores confiables. En JavaScript y TypeScript. Extrae datos para AI, LLMs, RAG o GPTs. Descarga HTML, PDF, JPG, PNG y otros archivos de sitios web. Funciona con Puppeteer, Playwright, Cheerio, JSDOM y HTTP directo. Modos con y sin interfaz gráfica. Con rotación de proxys.
★ 25.556+98Variación de estrellas de los últimos 7 días - #10
🚀 「Douyin_TikTok_Download_API」 es una herramienta de extracción de datos asíncrona de alto rendimiento y lista para usar para Douyin, Kuaishou, TikTok y Bilibili, que admite llamadas a API, análisis por lotes en línea y descargas.
★ 19.727+192Variación de estrellas de los últimos 7 días - #11
🔥 La plataforma de código abierto sin código para web scraping, rastreo, búsqueda y extracción de datos con IA • Convierte sitios web en API estructuradas en minutos 🔥
★ 17.322+70Variación de estrellas de los últimos 7 días - #12
Alternativa a NotebookLM de código abierto. Investiga la web abierta con datos en vivo (Reddit, YT, IG, TikTok, Indeed, Google Search, Maps, etc.) a través de una plataforma, API o servidor MCP. Únete a nuestro Discord: https://discord.gg/ejRNvftDp9
★ 16.029+46Variación de estrellas de los últimos 7 días - #13
Convierte sitios web de documentación, repositorios de GitHub y archivos PDF en habilidades de Claude AI con detección automática de conflictos
★ 14.858+64Variación de estrellas de los últimos 7 días - #14
📊 APIs para automatización web, pruebas y elusión de detección de bots.
★ 12.971+30Variación de estrellas de los últimos 7 días - #15
jsoup: el analizador HTML de Java, diseñado para la edición, limpieza, extracción y seguridad XSS de HTML.
★ 11.384+0Variación de estrellas de los últimos 7 días - #16
Puente de automatización de navegador de alto rendimiento y orquestador multi-instancia con inyección sigilosa avanzada y panel en tiempo real.
★ 10.173+57Variación de estrellas de los últimos 7 días - #17
Crawlee: una biblioteca de web scraping y automatización de navegadores para Python para crear rastreadores confiables. Extrae datos para IA, LLMs, RAG o GPTs. Descarga HTML, PDF, JPG, PNG y otros archivos de sitios web. Funciona con Parsel, BeautifulSoup, Playwright y HTTP sin procesar. En modos con interfaz gráfica y sin cabeza (headless). Con rotación de proxies.
★ 9477+19Variación de estrellas de los últimos 7 días - #18
Navegador headless sigiloso para agentes de IA: evade Cloudflare, detección de bots y anti-scraping. Reemplazo directo para Puppeteer/Playwright.
★ 8960+195Variación de estrellas de los últimos 7 días - #19★ 8324-1Variación de estrellas de los últimos 7 días
- #20
Lista de bibliotecas, herramientas y APIs para web scraping y procesamiento de datos.
★ 8138+10Variación de estrellas de los últimos 7 días - #21
Un web scraper inteligente, automático, rápido y ligero para Python
★ 7915+25Variación de estrellas de los últimos 7 días - #22
Este repositorio de GitHub es una potente colección de APIs que puedes empezar a usar de inmediato para crear desde automatizaciones simples hasta aplicaciones a gran escala. Una de las listas de APIs más valiosas de GitHub, sin duda. 💪
★ 7556+47Variación de estrellas de los últimos 7 días - #23
🔥 Servidor oficial Firecrawl MCP - Añade potentes funciones de extracción y búsqueda web a Cursor, Claude y cualquier otro cliente LLM.
★ 7347+58Variación de estrellas de los últimos 7 días - #24★ 7082+14Variación de estrellas de los últimos 7 días
- #25
Pydoll es una biblioteca para automatizar navegadores basados en chromium sin un WebDriver, ofreciendo interacciones realistas.
★ 7053+16Variación de estrellas de los últimos 7 días - #26
Herramienta de Python y línea de comandos para recopilar texto y metadatos en la web: rastreo, extracción y salida en CSV, JSON, HTML, MD, TXT, XML
★ 6728+50Variación de estrellas de los últimos 7 días - #27
Enlace de Python para el fork de curl-impersonate mediante cffi. Un cliente HTTP que puede suplantar huellas dactilares tls/ja3/http2 de navegadores.
★ 6416+56Variación de estrellas de los últimos 7 días - #28
Lenguaje declarativo de automatización de datos y tiempo de ejecución en Go para flujos de trabajo de extracción estructurada.
★ 6008-1Variación de estrellas de los últimos 7 días - #29
Extrae datos de Google Maps. Obtiene información como nombre, dirección, número de teléfono, URL del sitio web, valoración, número de reseñas, latitud y longitud, reseñas, correo electrónico y más para cada lugar.
★ 5662+84Variación de estrellas de los últimos 7 días - #30
CLI de automatización de navegadores creado para agentes de IA. Supera los muros anti-bot y transfiere el control a humanos entre plataformas cuando se atasque. Ejecución multitarea en paralelo, operación independiente de múltiples sesiones y navegación aislada en múltiples cuentas.
★ 5522+129Variación de estrellas de los últimos 7 días