Crawl4AI

🚀🤖 Crawl4AI: LLM向けのオープンソースWebクローラー&スクレイパー。気軽にこちらから参加してください: https://discord.gg/jP8KfhDhyN

現在も活発に開発中:直近 90 日間のコミットは 139 件、最新コミットは 2026-09-25。

GitHub スター
8.5万
直近 30 日のスター増加
+3,492
直近 90 日のコミット
139
直近 6 か月のリリース
8

Crawl4AIは、WebコンテンツをLLMで扱いやすい形式で抽出するために設計されたオープンソースのWebクローラー兼スクレイパーです。生のWebページを、検索拡張生成(RAG)システム、AI Agent、データパイプライン向けに最適化された、クリーンで構造化されたMarkdownに変換します。Shadow DOM、同意ポップアップ、ボット対策検知システムなどの複雑なWeb要素を処理することで、高品質なWebデータを言語モデルに供給するという共通の課題に対応します。GitHubスター数は62,000を超え、信頼性の高いWebデータ抽出を必要とするAIアプリケーションを構築する開発者の間で広く支持されています。最近の更新には、自動プロキシエスカレーションを伴う高度なボット対策検知、長時間クロールのクラッシュ復旧、URL検出を5-10x高速化できるプリフェッチモードが含まれます。大規模なコミュニティによる実運用で検証されており、スケーラブルなデプロイに向けて、オープンソースのセルフホストと近日提供予定のクラウドAPIの両方を提供します。

他ツールとの違い

生のHTMLを出力する汎用スクレイパーとは異なり、スマートなMarkdown生成によりLLMでそのまま使える出力に特化 — スター数#1のオープンソースクローラー

主な機能

  • WebページをLLMでそのまま使えるクリーンなMarkdownに変換
  • セッション管理付きの非同期ブラウザプール
  • LLMによる構造化データ抽出
  • 3段階のプロキシエスカレーションを伴うボット対策検知
  • BFS戦略とクラッシュ復旧を備えた深層クロール
  • Shadow DOMのフラット化と動的なJS実行
  • CLIおよびPython APIインターフェース
  • CSS/XPathベースのスキーマ抽出

向いている用途

  • WebコンテンツからのRAGデータパイプライン構築
  • AI学習データ向けの大規模Webスクレイピング

向いていない用途

  • 単純な静的ページのスクレイピング(requests/BeautifulSoupを使用)
  • リアルタイムのWebデータストリーミング

制限事項

  • Pythonのみ — JavaScript/TypeScript SDKなし
  • Playwrightブラウザのインストールが必須
  • ボット対策の回避によるサイト利用規約違反の可能性
  • 大規模な並行クロール時の高いメモリ使用量

Crawl4AI の代替ツール

  • Firecrawl:🔥 AI向けWebデータAPI - Webサイト全体をLLM向けのmarkdownや構造化データに変換(18.7万スター)
  • Scrapegraph-ai(2.3万スター)
  • GPT Crawler(2.2万スター)
  • Steel(7,717スター)
  • Browser-Use:🌐 AI Agentがウェブサイトにアクセスできるようにします。オンラインのタスクを簡単に自動化します。(11.7万スター)
  • LaVague(6,394スター)

代替ツールの詳しい比較(英語)→

よくある質問

Crawl4AI とは?
Crawl4AIは、WebコンテンツをLLMで扱いやすい形式で抽出するために設計されたオープンソースのWebクローラー兼スクレイパーです。生のWebページを、検索拡張生成(RAG)システム、AI Agent、データパイプライン向けに最適化された、クリーンで構造化されたMarkdownに変換します。Shadow DOM、同意ポップアップ、ボット対策検知システムなどの複雑なWeb要素を処理することで、高品質なWebデータを言語モデルに供給するという共通の課題に対応します。GitHubスター数は62,000を超え、信頼性の高いWebデータ抽出を必要とするAIアプリケーションを構築する開発者の間で広く支持されています。最近の更新には、自動プロキシエスカレーションを伴う高度なボット対策検知、長時間クロールのクラッシュ復旧、URL検出を5-10x高速化できるプリフェッチモードが含まれます。大規模なコミュニティによる実運用で検証されており、スケーラブルなデプロイに向けて、オープンソースのセルフホストと近日提供予定のクラウドAPIの両方を提供します。
Crawl4AI は現在もメンテナンスされていますか?
現在も活発に開発中:直近 90 日間のコミットは 139 件、最新コミットは 2026-09-25。
Crawl4AI の代替ツールは?
Crawl4AI に近いオープンソースの代替ツール:Firecrawl、Scrapegraph-ai、GPT Crawler、Steel、Browser-Use、LaVague。
Crawl4AI はオープンソースですか?
はい。Crawl4AI はオープンソースで、コードは GitHub で公開されています。

スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/unclecode/crawl4ai

AI エージェントツールを開発していますか?

無料で掲載を申請できます。有料で審査を早めることもできます。

ツールを登録する →