メインコンテンツへスキップ
buildradar
トピック · web-scraping

web-scraping

web-scraping がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
117
総スター数
837,510
平均スター数
7,158
シェア
0.04%

web-scraping と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、web-scraping がタグ付けされたリポジトリ。

  • creatorhub@3441293738

    マルチプラットフォームのコンテンツ監視・収集・転送:TikTok、小紅書(Xiaohongshu)、快手(Kuaishou)を1つのWebパネルで管理

    1,781
  • moli@lexmount

    AI エージェント向けに最適なヘッドレスブラウザ。軽量、高速、高互換。Rust 製

    1,481
  • trawl@germondai

    セルフホスト型のスクレイピングエンジン。Cloudflare、Turnstile、reCAPTCHA、hCaptcha、GeeTestなどのJSチャレンジやCAPTCHAを回避します。FlareSolverrやByparrの代替となり、*arrスタックにそのまま組み込んで置き換えることが可能です。

    742
  • browser-search@Johell1NS

    A skill for AI agents: search the web with SearXNG, browse with Camofox, bypass protections with CloakBrowser. Anti-hallucination by design. Self-hosted, free, unlimited.

    506
  • oc@only-cli

    Turn any website into a compact CLI tailored for AI agents. Browse the web in hundreds of tokens, not tens of thousands.

    412
  • firecrawl@firecrawl

    大規模にウェブを検索、スクレイピング、操作するためのContext API。🔥

    174,034+3,406直近 7 日のスター増減
  • Scrapling@D4Vinci

    🕷️ 単一のリクエストからフルスケールのクロールまで、すべてを処理する適応型Webスクレイピングフレームワーク!

    77,158+1,432直近 7 日のスター増減
  • scrapy@scrapy

    Scrapyは、Python向けの高速な高レベルWebクローリング&スクレイピングフレームワークです。

    64,098+106直近 7 日のスター増減
  • changedetection.io@dgtlmoon

    ウェブサイトの変更検出、ウェブページ監視、ウェブサイト変更アラートのための最良かつ最もシンプルなツール。コンテンツの変更追跡、価格の下落、再入荷アラート、ウェブサイトの改ざん監視に最適です—すべて無料で、またはSaaSプランをお楽しみください!

    33,414+132直近 7 日のスター増減
  • ai-website-cloner-template@JCodesMore

    AIコーディングエージェントを使用して、ワンコマンドで任意のウェブサイトをクローン。

    33,352+683直近 7 日のスター増減
  • CloakBrowser@CloakHQ

    すべてのボット検出テストを通過するステルスChromium。ソースレベルのフィンガープリントパッチを備えたPlaywrightのドロップイン代替品。30/30のテストを通過。

    30,947+439直近 7 日のスター増減
  • PythonによるオープンソースのAI求職応募ボット:ブラウザ自動化とウェブスクレイピングにより求人情報を読み取り、各求人ごとにカスタマイズされた履歴書とカバーレターで自動応募を行う。

    30,278+58直近 7 日のスター増減
  • Scrapegraph-ai@ScrapeGraphAI

    AIベースの Python スクレイパー

    30,047+244直近 7 日のスター増減
  • crawlee@apify

    Crawlee—信頼性の高いクローラーを構築するためのNode.js用ウェブスクレイピングおよびブラウザ自動化ライブラリ。JavaScriptおよびTypeScriptで記述。AI、LLM、RAG、またはGPTs用のデータを抽出可能。ウェブサイトからHTML、PDF、JPG、PNGなどのファイルをダウンロード可能。Puppeteer、Playwright、Cheerio、JSDOM、および生のHTTPに対応。ヘッドフルモードとヘッドレスモードの両方に対応。プロキシローテーション機能付き。

    25,556+98直近 7 日のスター増減
  • 🚀「Douyin_TikTok_Download_API」は、すぐに使える高性能な非同期データスクレイピングツールであり、Douyin、快手、TikTok、Bilibiliのデータをサポートし、API呼び出し、オンラインでの一括解析およびダウンロードが可能です。

    19,727+192直近 7 日のスター増減
  • maxun@getmaxun

    🔥 ウェブスクレイピング、クローリング、検索、AIデータ抽出のためのオープンソースのノーコードプラットフォーム • ウェブサイトを数分で構造化されたAPIに変換 🔥

    17,322+70直近 7 日のスター増減
  • SurfSense@MODSetter

    オープンソースのNotebookLM代替品。単一のプラットフォーム、API、またはMCPサーバーを通じて、ライブデータ(Reddit, YT, IG, TikTok, Indeed, Google Search, Mapsなど)でオープンウェブをリサーチ。Discordに参加: https://discord.gg/ejRNvftDp9

    16,029+46直近 7 日のスター増減
  • Skill_Seekers@yusufkaraaslan

    ドキュメントウェブサイト、GitHubリポジトリ、PDFを自動的な競合検出によりClaude AIスキルに変換。

    14,858+64直近 7 日のスター増減
  • SeleniumBase@seleniumbase

    📊 Web自動化、テスト、ボット検出回避のためのAPI。

    12,971+30直近 7 日のスター増減
  • jsoup@jhy

    jsoup: HTML編集、クリーンアップ、スクレイピング、XSS対策のために構築されたJava HTMLパーサー。

    11,384+0直近 7 日のスター増減
  • pinchtab@pinchtab

    高性能なブラウザ自動化ブリッジおよびマルチインスタンスオーケストレーター。高度なステルスインジェクションとリアルタイムダッシュボードを搭載。

    10,173+57直近 7 日のスター増減
  • crawlee-python@apify

    Crawlee—信頼性の高いクローラーを構築するためのPython用ウェブスクレイピングおよびブラウザ自動化ライブラリ。AI、LLM、RAG、またはGPTs向けにデータを抽出。ウェブサイトからHTML、PDF、JPG、PNGなどのファイルをダウンロード可能。Parsel、BeautifulSoup、Playwright、および生のHTTPに対応。ヘッドフルモードとヘッドレスモードの両方に対応。プロキシローテーション機能付き。

    9,477+19直近 7 日のスター増減
  • camofox-browser@jo-inc

    AIエージェント向けのステルスヘッドレスブラウザ — Cloudflare、ボット検出、アンチスクレイピングをバイパス。ドロップイン可能な Puppeteer/Playwright の代替。

    8,960+195直近 7 日のスター増減
  • helium@mherrmann

    Pythonによる軽量なWeb自動化。

    8,324-1直近 7 日のスター増減
  • awesome-web-scraping@lorien

    Webスクレイピングおよびデータ処理のためのライブラリ、ツール、APIのリスト

    8,138+10直近 7 日のスター増減
  • autoscraper@alirezamika

    Python向けスマートで自動化された高速軽量Webスクレイパー

    7,915+25直近 7 日のスター増減
  • API-mega-list@cporter202

    この GitHub リポジトリは、シンプルな自動化からフルスケールのアプリケーションまで、すぐに利用できる強力な API のコレクションです。GitHub 上で最も価値のある API リストの一つです。💪

    7,556+47直近 7 日のスター増減
  • firecrawl-mcp-server@firecrawl

    🔥 公式Firecrawl MCPサーバー - Cursor、Claude、およびその他のLLMクライアントに強力なウェブスクレイピングと検索機能を追加。

    7,347+58直近 7 日のスター増減
  • rod@go-rod

    ウェブ自動化およびスクレイピングのためのChrome DevTools Protocolドライバー。

    7,082+14直近 7 日のスター増減
  • pydoll@autoscrape-labs

    Pydollは、WebDriverなしでChromiumベースのブラウザを自動化するためのライブラリであり、リアルな操作を提供します。

    7,053+16直近 7 日のスター増減
  • trafilatura@adbar

    Pythonおよびコマンドラインツール。Web上のテキストとメタデータを収集:クローリング、スクレイピング、抽出、CSV、JSON、HTML、MD、TXT、XMLとしての出力。

    6,728+50直近 7 日のスター増減
  • curl_cffi@lexiforest

    cffi経由のcurl-impersonateフォーク用のPythonバインディング。ブラウザのTLS/ja3/http2フィンガープリントをなりすますことができるHTTPクライアント。

    6,416+56直近 7 日のスター増減
  • ferret@MontFerret

    宣言的なデータ自動化言語と、構造化抽出ワークフローのためのGoランタイム。

    6,008-1直近 7 日のスター増減
  • Google Mapsからデータをスクレイピングします。各場所の名前、住所、電話番号、ウェブサイトURL、評価、レビュー数、緯度と経度、レビュー、Eメールなどのデータを抽出します。

    5,662+84直近 7 日のスター増減
  • skills@browser-act

    AIエージェント向けに構築されたブラウザ自動化CLI。アンチボットの壁を突破し、行き詰まった場合はプラットフォームを横断して人間へ引き継ぎ。並列マルチタスク実行、独立したマルチセッション操作、分離されたマルチアカウントブラウジングに対応。

    5,522+129直近 7 日のスター増減
← トピック一覧に戻る