web-scraping
Repositórios de código aberto acompanhados marcados com web-scraping, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de web-scraping no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com web-scraping.
- #1
Monitoramento, coleta e transferência de conteúdo multiplataforma. Um painel web para gerenciar Douyin / Xiaohongshu / Kuaishou.
★ 1.781 - #2
O melhor navegador headless para agentes de IA. Leve, rápido e de alta compatibilidade. Construído em Rust.
★ 1.481 - #3
Motor de scraping auto-hospedado — contorna qualquer desafio de JS e captcha: Cloudflare, Turnstile, reCAPTCHA, hCaptcha, GeeTest. Alternativa ao FlareSolverr e Byparr, e substituto direto para sua stack *arr.
★ 742 - #4
A skill for AI agents: search the web with SearXNG, browse with Camofox, bypass protections with CloakBrowser. Anti-hallucination by design. Self-hosted, free, unlimited.
★ 506 - #5
Turn any website into a compact CLI tailored for AI agents. Browse the web in hundreds of tokens, not tens of thousands.
★ 412
- #1
A API de contexto para pesquisar, extrair dados e interagir com a web em escala.
★ 174.034+3.406Variação de estrelas nos últimos 7 dias - #2
🕷️ Um framework adaptativo de Web Scraping que lida com tudo, desde uma única requisição até um rastreamento em grande escala!
★ 77.158+1.432Variação de estrelas nos últimos 7 dias - #3★ 64.098+106Variação de estrelas nos últimos 7 dias
- #4
A melhor e mais simples ferramenta para detecção de alterações em sites, monitoramento de páginas web e alertas de mudanças em sites. Perfeito para rastrear alterações de conteúdo, quedas de preços, alertas de reposição de estoque e monitoramento de desfiguração de sites — tudo de graça ou aproveite nosso plano SaaS!
★ 33.414+132Variação de estrelas nos últimos 7 dias - #5
Clone qualquer site com um único comando usando agentes de IA para codificação
★ 33.352+683Variação de estrelas nos últimos 7 dias - #6
Chromium furtivo que passa em todos os testes de detecção de bots. Substituto direto do Playwright com patches de impressão digital em nível de código-fonte. 30/30 testes aprovados.
★ 30.947+439Variação de estrelas nos últimos 7 dias - #7
Bot de código aberto em Python para candidatura a vagas de emprego com IA: automação de navegador e web scraping para ler anúncios de vagas e, em seguida, candidatar-se automaticamente com um currículo e carta de apresentação personalizados para cada vaga.
★ 30.278+58Variação de estrelas nos últimos 7 dias - #8
Scraper em Python baseado em IA
★ 30.047+244Variação de estrelas nos últimos 7 dias - #9
Crawlee—Uma biblioteca de web scraping e automação de navegadores para Node.js para criar crawlers confiáveis. Em JavaScript e TypeScript. Extraia dados para IA, LLMs, RAG ou GPTs. Baixe HTML, PDF, JPG, PNG e outros arquivos de sites. Funciona com Puppeteer, Playwright, Cheerio, JSDOM e HTTP puro. Modos headful e headless. Com rotação de proxy.
★ 25.556+98Variação de estrelas nos últimos 7 dias - #10
Douyin_TikTok_Download_API é uma ferramenta de scraping de dados de alto desempenho e assíncrona para Douyin, Kuaishou, TikTok e Bilibili, pronta para uso, com suporte a chamadas de API e análise e download em lote online.
★ 19.727+192Variação de estrelas nos últimos 7 dias - #11
🔥 A plataforma open-source no-code para web scraping, crawling, busca e extração de dados com IA • Transforme sites em APIs estruturadas em minutos 🔥
★ 17.322+70Variação de estrelas nos últimos 7 dias - #12
Alternativa open-source ao NotebookLM. Pesquise na web aberta com dados em tempo real (Reddit, YT, IG, TikTok, Indeed, Google Search, Maps, etc.) através de uma única plataforma, API ou servidor MCP.
★ 16.029+46Variação de estrelas nos últimos 7 dias - #13
Converta sites de documentação, repositórios GitHub e PDFs em habilidades para o Claude AI com detecção automática de conflitos.
★ 14.858+64Variação de estrelas nos últimos 7 dias - #14
📊 APIs para automação web, testes e contorno de detecção de bots.
★ 12.971+30Variação de estrelas nos últimos 7 dias - #15
jsoup: o parser de HTML para Java, criado para edição, limpeza, scraping e segurança XSS de HTML.
★ 11.384+0Variação de estrelas nos últimos 7 dias - #16
Ponte de automação de navegador de alto desempenho e orquestrador multi-instância com injeção furtiva avançada e painel em tempo real.
★ 10.173+57Variação de estrelas nos últimos 7 dias - #17
Crawlee — Uma biblioteca de web scraping e automação de navegador para Python para criar crawlers confiáveis. Extraia dados para IA, LLMs, RAG ou GPTs. Baixe HTML, PDF, JPG, PNG e outros arquivos de sites. Funciona com Parsel, BeautifulSoup, Playwright e HTTP bruto. Modos headful e headless. Com rotação de proxy.
★ 9.477+19Variação de estrelas nos últimos 7 dias - #18
Navegador headless furtivo para agentes de IA — contorne Cloudflare, detecção de bots e anti-scraping. Substituição direta para Puppeteer/Playwright.
★ 8.960+195Variação de estrelas nos últimos 7 dias - #19★ 8.324-1Variação de estrelas nos últimos 7 dias
- #20
Lista de bibliotecas, ferramentas e APIs para web scraping e processamento de dados.
★ 8.138+10Variação de estrelas nos últimos 7 dias - #21
Um web scraper inteligente, automático, rápido e leve para Python
★ 7.915+25Variação de estrelas nos últimos 7 dias - #22
Este repositório do GitHub é uma coleção poderosa de APIs que você pode começar a usar imediatamente para construir desde automações simples até aplicações em larga escala. Uma das listas de API mais valiosas do GitHub.
★ 7.556+47Variação de estrelas nos últimos 7 dias - #23
🔥 Servidor MCP oficial do Firecrawl - Adiciona recursos poderosos de web scraping e busca ao Cursor, Claude e outros clientes LLM.
★ 7.347+58Variação de estrelas nos últimos 7 dias - #24★ 7.082+14Variação de estrelas nos últimos 7 dias
- #25
Pydoll é uma biblioteca para automatizar navegadores baseados em Chromium sem um WebDriver, oferecendo interações realistas.
★ 7.053+16Variação de estrelas nos últimos 7 dias - #26
Ferramenta de linha de comando e Python para coletar texto e metadados na Web: crawling, scraping, extração e saída em CSV, JSON, HTML, MD, TXT, XML
★ 6.728+50Variação de estrelas nos últimos 7 dias - #27
Binding em Python para o fork do curl-impersonate via cffi. Um cliente HTTP capaz de simular impressões digitais tls/ja3/http2 de navegadores.
★ 6.416+56Variação de estrelas nos últimos 7 dias - #28
Linguagem declarativa de automação de dados e runtime em Go para fluxos de trabalho de extração estruturada.
★ 6.008-1Variação de estrelas nos últimos 7 dias - #29
Extração de dados do Google Maps. Coleta informações como nome, endereço, número de telefone, URL do site, avaliação, número de avaliações, latitude e longitude, comentários, e-mail e muito mais para cada local
★ 5.662+84Variação de estrelas nos últimos 7 dias - #30
CLI de automação de navegador criada para agentes de IA. Supere barreiras anti-bot, transfira para humanos entre plataformas quando bloqueado. Execução multitarefa paralela, operação multissessão independente, navegação multi-conta isolada.
★ 5.522+129Variação de estrelas nos últimos 7 dias