Tony Wang17 分で読めますWebのどれくらいがアンチボットを導入しているのか?上位1,000,000サイトをスキャンしました
上位1,000,000サイトをスキャンした結果、到達できたWebの53.5%がマネージド型のアンチボットまたはWAFを稼働させていました。しかも意外にも、最もアクセスの多いサイトほど導入率が低いのです。
「とりあえずスクレイピングしてみよう」というプロジェクトの多くは、HTMLのパースで頓挫するわけではありません。頓挫するのは、そのページがCloudflareやDataDomeの背後にあることが判明し、当初組み立てたのとはまったく異なるアプローチが必要になったときです。そこで私たちは、それが実際にどれくらい一般的なのかを測定しました。しかも二度です。まずTrancoの上位1,000,000サイト全体をスキャンしてWeb規模の全体像を把握し、次に28カテゴリにわたって1,005件の実在する公開サイトを、つまり人々が実際にスクレイピングするようなサイトを手作業で選び、それらに対して全トランスポート群をぶつけました。要約すると、到達できるWebのちょうど半分強がマネージド型のボット防御を稼働させ、それは1つのベンダーに集中しており、最もアクセスの多いサイトほどそれを最も少なく導入しており、難易度は極端にばらついている、ということです。
検索可能な完全なデータセット(すべてのサイトを、ベンダー・難易度・カテゴリで絞り込み可能)は、アンチボット導入指数(Anti-Bot Adoption Index)にあります。
WebのどれくらいがアンチボットまたはWAFを稼働させているのか?
上位1,000,000サイト全体のうち、私たちは818,614サイトに到達しました(残りは名前解決できなかったか、タイムアウトしたか、私たちのデータセンターからの接続を明確にブロックしました。約18%で、割合の算出からは除外しています)。到達できたサイトのうち、53.5%がマネージド型のWAF、ボット管理、またはアクセス制御ベンダーを露出させています。これはCAPTCHAウィジェットやレート制限のみは数えていません。
| 保護の種類 | 到達サイトに占める割合 |
|---|---|
| マネージドWAF | 47.6% |
| CAPTCHAウィジェット(reCAPTCHA、hCaptcha、Turnstileなど) | 12.7% |
| アクセス制御 | 2.1% |
| 専用のボット管理 | 0.8% |
| いずれかのマネージド型アンチボット / WAF | 53.5% |
これは断片化した市場ではありません。Cloudflareだけで、到達できた全サイトの45%をカバーしており、保護されている全サイトの84%にあたります。次に大きい名前のあるレイヤーは、消費者向けのCAPTCHAウィジェットです。純粋なボット管理専業ベンダーは、Web規模ではほとんど存在感がありません。Akamai Bot Manager 0.6%、DataDome 0.16%、PerimeterX/HUMAN 0.09%です。
これらの数字は、独立した測定結果とも一致します。W3Techs(2026年6月)はCloudflareを全Webサイトの23.2%、上位1Mの約**48.7%に導入されているとしています。私たちは、到達できた上位1Mの45%でそのアクティブなアンチボットの構えを検出しており、異なる手法から得た同程度の水準です。そしてImperva 2025 Bad Botレポートは、自動化トラフィックが現在すべてのWebトラフィックの51%**を占める(悪質なボットは37%)としています。これほど多くのサイトがそもそも壁を持っている理由を説明する需要圧力です。(Web規模の測定に関する同種の手法については、HTTP Archive Web Almanacを参照してください。)
最もアクセスの多いサイトほどアンチボットの導入率が低い
Web規模の数字は、最も有用な発見を覆い隠しています。100万サイトをトラフィックランクで分割すると、3つの曲線がすべて連動して動きます。保護率、Cloudflare、そして専門ベンダーです。
| Trancoランク帯 | 保護あり | Cloudflare | エンタープライズ向けボット管理¹ |
|---|---|---|---|
| 上位1,000 | 44.2% | 23.4% | 7.6% |
| 1k–10k | 50.7% | 34.0% | 5.3% |
| 10k–100k | 52.3% | 40.2% | 2.6% |
| 100k–1M | 53.6% | 45.6% | 0.6% |
¹ Akamai Bot Manager + DataDome + PerimeterX を、その帯における到達サイトに占める割合として算出。
ランクを下るにつれて、2つのことが反転します。Cloudflareは上昇し(上位1,000サイトの23%からロングテールの46%へ)、そのWeb規模での支配力はロングテールの物語です。巨大サイトは自社またはエンタープライズのインフラを運用し、SEOのためにホームページを開いたままにしておく一方、無数の小規模サイトはすぐに使えるCloudflareに手を伸ばします。一方でエンタープライズ向けボット管理は低下します(7.6%から0.6%へ)。DataDome、PerimeterX、Akamai Bot Managerはヘッドの現象であり、自動化されたデータが直接的なドルコストを持つ高価値サイトによって導入されています。つまりヘッドとテールは、単に保護率が異なるだけでなく、異なるベンダーによって守られているのです。(W3Techsも同じ方向性を捉えています。Cloudflareは最上位1,000サイトでは、より広い上位1M全体よりも低いのです。)
Cloudflareを脇に置くと(これは全域で上昇します)、専門のゲートキーパーはランクによって立場を入れ替えます。Akamaiは最上位を守り、ロングテールはすぐに使えるCAPTCHAに手を伸ばします。
人々が実際にスクレイピングする約1,005件の高価値サイトにズームインすると、ヘッドのプロファイルはさらに鮮明になります。そこではエンタープライズ向けボット管理がサイトの**15.5%**に載っており、テールの安価なCAPTCHAウィジェットのレイヤーはほぼ消えます。導入率と高度さは別の軸です。Webは思っているより多くが「保護」されていますが、難しいものははるかに少ないのです。
それらの壁のほとんどは眠っている
ここが最も私たちを驚かせた部分です。「53.5%が保護あり」は、マネージド型ベンダーを露出させているすべてのサイトを数えています。しかし露出させていることは、それを使っていることと同じではありません。到達できた818,614サイトのうち、実際に私たちのホームページリクエストに**チャレンジを課したのはわずか79,835サイト(9.8%)**でした。残りの358,022件の壁つきサイトはベンダーをパッシブに稼働させており、一致するリクエストにはクリーンな200を返しました。100万サイトを、実際に反撃するごく少数までたどってみましょう。
Show the flows
| スキャン済み → 到達可能 | 818,614 (36.3%) |
| 到達可能 → 壁あり | 437,857 (19.4%) |
| 到達可能 → 壁なし | 380,757 (16.9%) |
| 壁あり → パッシブに存在 | 358,022 (15.9%) |
| スキャン済み → 到達不可 | 179,883 (8%) |
| 壁あり → アクティブにチャレンジ | 79,835 (3.5%) |
どの壁が「目覚めている」かは、ベンダーに大きく依存します。Cloudflareは到達できるWebの45%の前に立っていますが、それらのホームページのうちアクティブにチャレンジしたのは約16%だけでした。Google reCAPTCHAはホームページではほとんど発火しません(3%)。少数の未特定WAFグループはその逆で、存在するのはまれですが、存在するときは76%の確率でチャレンジを課します。
実務上の要点はこうです。ベンダーのフィンガープリントは、壁が発火した場合に直面するものを教えてくれます。しかしほとんどのホームページはそもそも発火しません。だからこそ、デフォルトでフルブラウザに手を伸ばすのは時間と予算の無駄になります。ロゴではなく、ページを確認しましょう。
ズームイン:人々が実際にスクレイピングする約1,005サイト
スクレイパーにとって重要なサイトについては、ヘッダーの先を見ます。データセンターからのGETをブロックするサイトは、全トランスポート群(ブラウザなりすましHTTP → ヘッドレスブラウザ → ステルスブラウザ + 住宅IP)を通して再プローブします。そのため難易度ティアは、ヘッダーからの推測ではなく、実際にページに到達するものを反映します。この基準で見ると、**1,005サイトのうち575サイト(57.2%)**がマネージド型のボット防御を稼働させており、2つのベンダーがそれを支配しています。
| ベンダー | 種類 | サイト数 | シェア |
|---|---|---|---|
| Cloudflare | WAF + チャレンジ | 333 | 33.1% |
| Akamai Bot Manager | ボット管理 | 111 | 11.0% |
| Akamai(エッジ) | CDN/WAF | 53 | 5.3% |
| DataDome | ボット管理 | 30 | 3.0% |
| Imperva (Incapsula) | WAF | 15 | 1.5% |
| PerimeterX (HUMAN) | ボット管理 | 15 | 1.5% |
| Cloudflare Turnstile | CAPTCHA | 12 | 1.2% |
CloudflareとAkamaiを合わせると、このセットで保護されている全サイトの77%を占めます。ベンダーを分けるのは何を検査するかです。Akamaiと開放的なCloudflareの経路はTLS/JA3-JA4フィンガープリンティングに最も強く依存しており、一致するHTTPクライアントでしばしば到達できます。一方でDataDomeとPerimeterXはリアルタイムの行動MLを加えるため、クリーンなフィンガープリントだけでは不十分です。
難易度は極端にばらついている。そのほとんどはブラウザの仕事ではない
より有用な問いは「保護されているか」ではなく、「公開ページに確実に到達するには何が必要か」です。キュレーションしたセットに対して本物の群をぶつけると、こうなります。
| ティア | 必要なもの | サイト数 | シェア |
|---|---|---|---|
| T1 | 単純なHTTPクライアント | 608 | 60.5% |
| T2 | ブラウザなりすましHTTP(一致するTLS) | 246 | 24.5% |
| T3 | JavaScriptを実行するヘッドレスブラウザ | 148 | 14.7% |
| T4 | ステルスブラウザ + 住宅IP + 挙動 | 3 | 0.3% |
これらのサイトの85%はブラウザをまったく必要としません。単純なHTTP GETか、一致するTLSフィンガープリントで到達できます。本当にヘッドレスブラウザ以上が必要なのは約15%だけです。デフォルトでブラウザに手を伸ばすのは、最も一般的で(そして最もコストのかかる)スクレイピングの間違いです。データが示すのは、サイトに強いられたときだけエスカレーションせよ、ということです。
これはまた、「57%が保護あり」と「85%はブラウザ不要」の両方が真である理由でもあります。ベンダーを検出することは二値的ですが、ベンダーが存在することは、それがアクティブにチャレンジすることと同じではありません。保護されている575サイトのうち、実際に私たちのリクエストにアクティブにチャレンジしたのは74サイトだけでした。残りはベンダーをパッシブなCDN/WAFモードで稼働させています(一致するフィンガープリントには200が返ります)。
難しい端:ごく少数のサイトがクローズドVMですべてのリクエストに署名する
最も手強いクラスはCAPTCHAではありません。すべてのリクエストに署名する独自のブラウザ内バイトコードVMです。そのため汎用のトランスポートツールでは有効なトークンを生成できません。キュレーションしたセットのうち4サイトがこれを搭載しています。TikTokのwebmssdk VM(X-Bogus / X-Gnarly署名で、Akamaiの上に載っています)と、Kasadaのproof-of-work VM(x-kpsdk-ctトークンで、不動産マーケットプレイス上にあります)です。これらには「より賢いリクエストを送る」は通用しません。本物のブラウザ実行コンテキストが必要です。まれではありますが、人々が「なぜこれをスクレイピングできないのか?」と最もよく尋ねるサイトです。(私たちは意図的にF5 BIG-IPのロードバランサーCookieはVMとして数えていません。それはサーバーの負荷分散であって、ボット防御ではないからです。)
ブロックはブロックではない。なぜ止められたのかを読む
リクエストが通らないとき、その理由が修正方法を教えてくれます。そして修正方法は毎回まったく異なります。群を通してエスカレーションした後でも、**1,005サイトのうち74サイト(7.4%)**だけがまだクリーンに通過せず、内訳は次のとおりです。
| 止められた理由 | サイト数 | 意味 | 修正方法 |
|---|---|---|---|
| ボットチャレンジ(JSインタースティシャル) | 55 | Cloudflareの「Just a moment」、JSチャレンジ | 本物のブラウザで実行する |
| CAPTCHA | 18 | インタラクティブなパズルが配信された | ブラウザ(+ CAPTCHAサービス) |
| ジオブロック | 1 | 国/地域でゲートされている | 許可された地域のIP |
見出しは、その失敗が何でないかです。適切なトランスポートを持ち込めば、正真正銘のレート制限や真っ向からのIP BANは、玄関口では極めてまれです。壁はほとんどの場合、プロキシの問題ではなくフィンガープリント/JSの問題です。私たちはラベルについて意図的に保守的でした。401はログインの壁として数えるのはWWW-Authenticateを伴う場合のみで(WSJとReutersは認証ではなくDataDomeのボットブロックとして401を返します)、一般的な403は、ページがそう明記していない限り「IP BAN」ではなく「ブロックされた」とします。
ホームページは貧弱な代理指標。保護はページごとに動く
この種の研究における最大の注意点は、1つのドメインがページの種類ごとにまったく異なる保護をかけていることです。LinkedInでは、ホームページは軽く、/company/ページはおおむね開かれていますが、/in/のプロフィールと検索はログインの壁があります。Amazonでは、ホームページは開かれている一方、検索はたやすく「Robot Check」を配信します。そのため指数の各サイトページには、助言的な深いページのテスト計画(どのページ種を確認すべきか、それぞれで何を予期すべきか)が付属しています。玄関口ではなく、実際に欲しいページをテストできるようにするためです。
防御の勾配:仮想通貨とコマースは要塞、検索は開かれている
キュレーションしたセットをカテゴリで分けると、明確なお金の勾配が現れます。ページが取引に近いほど、防御は堅くなります。
| カテゴリ | マネージド型アンチボット / WAF の割合 |
|---|---|
| 仮想通貨 | 86% |
| マーケットプレイス | 81% |
| AIツール | 78% |
| 金融・市場 | 75% |
| フォーラム・コミュニティ | 75% |
| Eコマース | 72% |
| 不動産 | 72% |
| 旅行・ホスピタリティ | 72% |
| … | |
| ニュース・メディア | 39% |
| スポーツ | 33% |
| ソーシャルメディア | 25% |
| 検索エンジン | 18% |
仮想通貨とマーケットプレイスが最も激しく戦います。価格、在庫、板情報はWebで最もスクレイピングされるデータだからです。ソーシャル、ニュース、検索の低い数字は、部分的には手法上のアーティファクトです。それらのホームページは意図的に開かれていますが、深いページ(プロフィール、記事アーカイブ、結果ページ)は、中に入った途端に保護ありに切り替わります。
スクレイパーを構築するなら、これが意味すること
- **構築する前に確認する。**ページがCloudflareの背後にあるのか、DataDomeなのか、クローズドVMなのか、何もないのかを知ることは、アプローチ全体を変えます。しかもそれはURLごとに変わります。30秒の確認が、なぜリクエストが
403になるのか悩む午後を丸ごと節約してくれます。各ベンダーが実際に何をするかについては、姉妹ガイドのボットをブロックするサイトのスクレイピングを参照してください。 - **サイトが要求する範囲だけエスカレーションし、成功したときだけ支払う。**人々がスクレイピングするサイトの85%はブラウザをまったく必要としません。コスト効率のよいパターンは、最も軽量なトランスポートをまず試してからエスカレーションすることです。それがまさに、CrawloraのAIとデータパイプライン向けWebスクレイピングの課金方法です。試行ごとではなく成功時課金(pay-on-success)です。
これはいずれも、CAPTCHAを打ち破ることや、ログインを突破することについての話ではありません。エンジニアリングの時間を投じる前に、どの公開ページにどのアプローチが必要かを知ることについての話です。
自分で試してみる
- 無料のアンチボットチェッカーで、今すぐ任意のURLを確認しましょう。ホームページだけでなく、プロフィールやリスティングのページを貼り付けて、ベンダーと、機能する最も軽量なトランスポートを確認してください。
- 完全なデータセットを探索しましょう。すべてのサイトを検索し、難易度・ベンダー・カテゴリで絞り込めます。アンチボット導入指数(Anti-Bot Adoption Index)にあります。
- 私たちがどのように測定したかを、シグネチャや難易度ヒューリスティックを含めて正確に読んでください。
このチェックが実際にどう動くのか(完全な透明性)
魔法はありません。これは意図的にシンプルで、パッシブで、再現可能なチェックであり、2つのスケールで実行されています。
サンプル。Web規模の数字は、Trancoの上位1,000,000全体(永続的なIDを持つ、集約された引用可能な上位サイトリスト)から得ており、そのうち818,614サイトが到達可能でした。深掘りの数字は、同じランキングの上位から28カテゴリにわたる実在する公開の、コンテンツを持つサイトへと歩いて集めた1,005ドメインから得ており、純粋なインフラ/CDN、広告/トラッキング、アダルトのドメインはスキップしています。
リクエスト。各サイトのホームページは、本物のChrome User-Agentで、リダイレクトをたどりながら、データセンターIPから取得します。「基本的なクラウドスクレイパーが見るもの」を正直に映す視点です。私たちはフォームの送信、CAPTCHAの実行、ログイン、壁の背後にあるものの取得は一切行いません。上位1Mスキャンは、この単一のデータセンターGETです。キュレーションしたセットについては、さらに踏み込みます。データセンターGETをブロックするサイトは全トランスポート群を通して再プローブ(ブラウザなりすまし → ヘッドレス → ステルス + 住宅IP)するため、その難易度ティアはヘッダーからの推測ではなく、実際にページに到達するものを反映します。
取得するもの(そして取得しないもの)。レスポンスから、私たちはステータスコード、レスポンスヘッダー、Set-Cookie Cookieの名前(名前のみで、値は決して取得しません。そのためセッショントークンやPIIは保存されません)、そして本文の上限を設けた一部分を保持します。それ以外は何も保持しません。
**ベンダーの特定。**ベンダーは、その証拠を公開され文書化されたフィンガープリントのデータベースと照合して特定します。ヘッダー名(cf-ray、x-datadome、x-iinfo、akamai-grn)、Set-Cookieの名前接頭辞(__cf_bm/cf_clearance、_abck/bm_sz、datadome、_px*、incap_ses_)、そしてチャレンジ形状のレスポンスでのみ信頼される本文マーカーです。ヘッダーとCookieの一致は高信頼度、本文マーカーは中程度です。
限界。すべての結果は下限です。ホームページは、人々が実際にスクレイピングする深いページよりも開かれており、データセンターIPは住宅IPよりも多くのチャレンジを見ます。上位1Mスキャンはヘッダーのみで、難易度は評価しません(そこでデータセンターGETをブロックするサイトは、ブラウザに対しては十分に開く可能性があります)。評価済みのティアとカテゴリ勾配は、全群でのキュレーション実行から得ています。アンチボットの導入は絶えず変化するため、すべての結果は保証ではなく方向性のシグナルとして扱ってください。スナップショット:2026年6月。
**オープンで再現可能。**分類器と手法は全文が公開されています。完全な手法を読むか、検索可能な指数を探索してください。引用する際は「Crawlora Anti-Bot Adoption Index」としてリンクを添えてください。
よくある質問
Webのどれくらいがアンチボットで保護されていますか?
私たちは二度測定しました。Tranco上位1,000,000サイト全体(到達可能818,614サイト)では、53.5%がマネージド型のアンチボット、WAF、またはアクセス制御ベンダーを露出させており、その大半は圧倒的にCloudflareでした(到達サイトの45%)。全トランスポート群を通した手作業選定の高価値1,005サイトでは、57.2%が保護されています。いずれも下限です。深いページ(プロフィール、リスティング、検索)は私たちがプローブしたホームページよりも防御されており、保護は仮想通貨(86%)とマーケットプレイス(81%)で最も重く、検索・ソーシャル・ニュースで最も軽くなります。
ほとんどのサイトをスクレイピングするのに、本当にブラウザが必要ですか?
いいえ。そしてそれこそが最もコストのかかる誤解です。キュレーションしたサイトのうち85%はブラウザをまったく必要としません。約60%は単純なHTTP GETに応答し、さらに25%は一致するTLSフィンガープリントを求めるだけです。本当にヘッドレスブラウザ以上が必要なのは約15%だけです。コスト効率のよいパターンは、デフォルトでヘッドレスブラウザに手を伸ばすのではなく、サイトに強いられた範囲だけエスカレーションすることです。
最も一般的なアンチボットベンダーはどれですか?
Cloudflareが大差でトップです。上位1,000,000サイト全体で到達サイトの45%、保護されている全サイトの84%をカバーしています。キュレーションしたセットでも33%でリードし、それにAkamai(Bot Manager 11% に加えてエッジCDN 5%)が続きます。専門のボット管理ベンダーであるDataDome(3%)とPerimeterX/HUMAN(1.5%)は、自動化されたデータが直接的なコストを持つマーケットプレイス、旅行、不動産などの高価値な業種に集まっています。
対処が最も難しいアンチボットの種類は何ですか?
すべてのリクエストに署名する、独自でクローズドなブラウザ内JavaScript VMです。たとえばTikTokのwebmssdk(X-Bogus/X-Gnarly署名)やKasada(x-kpsdk-ctトークン)で、キュレーションしたセットのうち4サイトがこれを搭載しています。CAPTCHAとは異なり、汎用のトランスポートツールでは有効なトークンを生成できないため、これらにはより賢いリクエストではなく本物のブラウザ実行コンテキストが必要です。まれではありますが、人々がなぜスクレイピングできないのかと最もよく尋ねるサイトです。
各サイトのアンチボットをどのように測定しましたか?
2つの方法です。上位1,000,000スキャンは、データセンターIPからの単一のパッシブなホームページGETで、レスポンスヘッダー(cf-ray、x-datadome)、Set-Cookie名(_abck、datadome、_px)、チャレンジマーカーを文書化されたベンダーのフィンガープリントと照合します。これはCrawloraのアンチボットチェッカーと同じシグネチャです。キュレーションしたセットについてはさらに踏み込みます。データセンターGETをブロックするサイトは全トランスポート群(ブラウザなりすまし → ヘッドレス → ステルス + 住宅IP)を通して再プローブするため、その難易度ティアはヘッダーからの推測ではなく、実際にページに到達するものを反映します。すべての結果は下限です。