Saltar al contenido principal
buildradar
Tema · web-scraping

web-scraping

Repositorios de código abierto monitorizados etiquetados con web-scraping, ordenados por estrellas.

Repositorios
117
Estrellas totales
837.510
Estrellas de media
7158
Proporción
0,04%

Temas que aparecen con frecuencia junto a web-scraping en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con web-scraping.

  • creatorhub@3441293738

    Monitorización, recopilación y transferencia de contenido multiplataforma. Un panel web para gestionar Douyin, Xiaohongshu y Kuaishou.

    1781
  • moli@lexmount

    El mejor navegador headless para agentes de IA. Ligero, rápido y de alta compatibilidad. Construido en Rust

    1481
  • trawl@germondai

    Motor de scraping autohospedado: evita cualquier desafío de JS y captcha: Cloudflare, Turnstile, reCAPTCHA, hCaptcha, GeeTest. Alternativa y reemplazo directo para FlareSolverr y Byparr en tu stack *arr.

    742
  • browser-search@Johell1NS

    A skill for AI agents: search the web with SearXNG, browse with Camofox, bypass protections with CloakBrowser. Anti-hallucination by design. Self-hosted, free, unlimited.

    506
  • oc@only-cli

    Turn any website into a compact CLI tailored for AI agents. Browse the web in hundreds of tokens, not tens of thousands.

    412
  • firecrawl@firecrawl

    La API de contexto para buscar, extraer e interactuar con la web a gran escala. 🔥

    174.034+3406Variación de estrellas de los últimos 7 días
  • Scrapling@D4Vinci

    🕷️ ¡Un framework de Web Scraping adaptativo que maneja todo, desde una sola solicitud hasta un rastreo a gran escala!

    77.158+1432Variación de estrellas de los últimos 7 días
  • scrapy@scrapy

    Scrapy, un marco de trabajo rápido y de alto nivel para rastreo y extracción web en Python.

    64.098+106Variación de estrellas de los últimos 7 días
  • changedetection.io@dgtlmoon

    La mejor y más simple herramienta para la detección de cambios en sitios web, monitoreo de páginas web y alertas de cambios. ¡Perfecto para rastrear cambios de contenido, bajadas de precio, alertas de reabastecimiento y monitoreo de desfiguración web, todo gratis o disfruta de nuestro plan SaaS!

    33.414+132Variación de estrellas de los últimos 7 días
  • ai-website-cloner-template@JCodesMore

    Clona cualquier sitio web con un solo comando usando agentes de codificación de IA

    33.352+683Variación de estrellas de los últimos 7 días
  • CloakBrowser@CloakHQ

    Chromium sigiloso que supera todas las pruebas de detección de bots. Reemplazo directo de Playwright con parches de huellas digitales a nivel de código fuente. 30/30 pruebas superadas.

    30.947+439Variación de estrellas de los últimos 7 días
  • Bot de código abierto en Python para postularse a empleos con IA: automatización del navegador y web scraping para leer ofertas de empleo, y luego postulación automática con un currículum y carta de presentación personalizados para cada oferta.

    30.278+58Variación de estrellas de los últimos 7 días
  • Scrapegraph-ai@ScrapeGraphAI

    Scraper de Python basado en IA

    30.047+244Variación de estrellas de los últimos 7 días
  • crawlee@apify

    Crawlee: una biblioteca de web scraping y automatización de navegadores para Node.js para crear rastreadores confiables. En JavaScript y TypeScript. Extrae datos para AI, LLMs, RAG o GPTs. Descarga HTML, PDF, JPG, PNG y otros archivos de sitios web. Funciona con Puppeteer, Playwright, Cheerio, JSDOM y HTTP directo. Modos con y sin interfaz gráfica. Con rotación de proxys.

    25.556+98Variación de estrellas de los últimos 7 días
  • 🚀 「Douyin_TikTok_Download_API」 es una herramienta de extracción de datos asíncrona de alto rendimiento y lista para usar para Douyin, Kuaishou, TikTok y Bilibili, que admite llamadas a API, análisis por lotes en línea y descargas.

    19.727+192Variación de estrellas de los últimos 7 días
  • maxun@getmaxun

    🔥 La plataforma de código abierto sin código para web scraping, rastreo, búsqueda y extracción de datos con IA • Convierte sitios web en API estructuradas en minutos 🔥

    17.322+70Variación de estrellas de los últimos 7 días
  • SurfSense@MODSetter

    Alternativa a NotebookLM de código abierto. Investiga la web abierta con datos en vivo (Reddit, YT, IG, TikTok, Indeed, Google Search, Maps, etc.) a través de una plataforma, API o servidor MCP. Únete a nuestro Discord: https://discord.gg/ejRNvftDp9

    16.029+46Variación de estrellas de los últimos 7 días
  • Skill_Seekers@yusufkaraaslan

    Convierte sitios web de documentación, repositorios de GitHub y archivos PDF en habilidades de Claude AI con detección automática de conflictos

    14.858+64Variación de estrellas de los últimos 7 días
  • SeleniumBase@seleniumbase

    📊 APIs para automatización web, pruebas y elusión de detección de bots.

    12.971+30Variación de estrellas de los últimos 7 días
  • jsoup@jhy

    jsoup: el analizador HTML de Java, diseñado para la edición, limpieza, extracción y seguridad XSS de HTML.

    11.384+0Variación de estrellas de los últimos 7 días
  • pinchtab@pinchtab

    Puente de automatización de navegador de alto rendimiento y orquestador multi-instancia con inyección sigilosa avanzada y panel en tiempo real.

    10.173+57Variación de estrellas de los últimos 7 días
  • crawlee-python@apify

    Crawlee: una biblioteca de web scraping y automatización de navegadores para Python para crear rastreadores confiables. Extrae datos para IA, LLMs, RAG o GPTs. Descarga HTML, PDF, JPG, PNG y otros archivos de sitios web. Funciona con Parsel, BeautifulSoup, Playwright y HTTP sin procesar. En modos con interfaz gráfica y sin cabeza (headless). Con rotación de proxies.

    9477+19Variación de estrellas de los últimos 7 días
  • camofox-browser@jo-inc

    Navegador headless sigiloso para agentes de IA: evade Cloudflare, detección de bots y anti-scraping. Reemplazo directo para Puppeteer/Playwright.

    8960+195Variación de estrellas de los últimos 7 días
  • helium@mherrmann

    Automatización web más ligera con Python

    8324-1Variación de estrellas de los últimos 7 días
  • awesome-web-scraping@lorien

    Lista de bibliotecas, herramientas y APIs para web scraping y procesamiento de datos.

    8138+10Variación de estrellas de los últimos 7 días
  • autoscraper@alirezamika

    Un web scraper inteligente, automático, rápido y ligero para Python

    7915+25Variación de estrellas de los últimos 7 días
  • API-mega-list@cporter202

    Este repositorio de GitHub es una potente colección de APIs que puedes empezar a usar de inmediato para crear desde automatizaciones simples hasta aplicaciones a gran escala. Una de las listas de APIs más valiosas de GitHub, sin duda. 💪

    7556+47Variación de estrellas de los últimos 7 días
  • firecrawl-mcp-server@firecrawl

    🔥 Servidor oficial Firecrawl MCP - Añade potentes funciones de extracción y búsqueda web a Cursor, Claude y cualquier otro cliente LLM.

    7347+58Variación de estrellas de los últimos 7 días
  • rod@go-rod

    Un controlador del protocolo Chrome DevTools para automatización web y scraping.

    7082+14Variación de estrellas de los últimos 7 días
  • pydoll@autoscrape-labs

    Pydoll es una biblioteca para automatizar navegadores basados en chromium sin un WebDriver, ofreciendo interacciones realistas.

    7053+16Variación de estrellas de los últimos 7 días
  • trafilatura@adbar

    Herramienta de Python y línea de comandos para recopilar texto y metadatos en la web: rastreo, extracción y salida en CSV, JSON, HTML, MD, TXT, XML

    6728+50Variación de estrellas de los últimos 7 días
  • curl_cffi@lexiforest

    Enlace de Python para el fork de curl-impersonate mediante cffi. Un cliente HTTP que puede suplantar huellas dactilares tls/ja3/http2 de navegadores.

    6416+56Variación de estrellas de los últimos 7 días
  • ferret@MontFerret

    Lenguaje declarativo de automatización de datos y tiempo de ejecución en Go para flujos de trabajo de extracción estructurada.

    6008-1Variación de estrellas de los últimos 7 días
  • Extrae datos de Google Maps. Obtiene información como nombre, dirección, número de teléfono, URL del sitio web, valoración, número de reseñas, latitud y longitud, reseñas, correo electrónico y más para cada lugar.

    5662+84Variación de estrellas de los últimos 7 días
  • skills@browser-act

    CLI de automatización de navegadores creado para agentes de IA. Supera los muros anti-bot y transfiere el control a humanos entre plataformas cuando se atasque. Ejecución multitarea en paralelo, operación independiente de múltiples sesiones y navegación aislada en múltiples cuentas.

    5522+129Variación de estrellas de los últimos 7 días
← Volver a temas