Tony Wang7 分で読めますウェブサイトが2026年にウェブスクレイピングをどう防ぐか(そして今も通用する手法)
トップ100万サイトの53.5%がアンチボットの壁を運用しています。TLS/ブラウザフィンガープリント、IPレピュテーション、Cloudflare がどうスクレイパーを検知するか——そして今も何が通り抜けるか。
ウェブスクレイピングのガイドの多くは、データをどう抽出するかを語ります。この記事が扱うのはその手前にある壁です——というのも2026年、あなたのスクレイパーが機能するかどうかを実際に決めるのはこの壁だからです。数字を出してみました。Tranco top 1,000,000 sitesのスキャン全体で、到達可能なサイトの53.5%がマネージド型のアンチボットシステムを運用しています。 ここでは、これらのシステムがどうスクレイパーを検知するか、誰がそれを作るのか、2026年に何が変わったのか、そして正当な収集が今も何を通り抜けられるのかを解説します。
アンチボット保護はどれくらい一般的か?
私たちのトップ1Mスキャンで到達可能だった約818,600サイトのうち、437,857——53.5%——がマネージド型のアンチボットの壁の内側にあります。 市場は極端に集中しています。Cloudflare が全サイトの45%の前面に立ち、保護されたサイトのおよそ84%を占めます。それ以外はすべてロングテールです。
| アンチボットベンダー | 全サイトに占める割合 | 備考 |
|---|---|---|
| Cloudflare | ~45% | 支配的な壁。無名になるほど増える |
| Google reCAPTCHA | 7.5% | 群を抜いて最も一般的な CAPTCHA |
| hCaptcha | 3.5% | プライバシー志向の CAPTCHA |
| Cloudflare Turnstile | 1.3% | CAPTCHA を置き換えるウィジェット |
| Imperva (Incapsula) | 0.6% | 成熟した WAF + ボット |
| Akamai Bot Manager | 0.6% | エンタープライズ向け。トラフィックのヘッドで最も強い |
| DataDome | 0.1% | 珍しいが高い技術力、ML 駆動 |
人々を驚かせる発見が2つあります。第一に、ランクを下るほど保護は強まります——トップ1,000サイトの44.2%が壁の内側なのに対し、テールでは53.6%です——これは Cloudflare の無料プランが何百万もの小規模サイトを守る一方で、エンタープライズ向けのボット管理(Akamai)は薄くなっていくためです。第二に、ホームページはそれを過小に見せます。ディープページの調査では、商品・一覧・プロフィールのページは48.4%が壁の内側で、ホームページの40.5%を上回り、ログインの内側にある可能性もはるかに高いものでした。あなたが本当に欲しいページは、玄関よりも堅く守られているのです。
ウェブサイトは2026年にどうスクレイパーを検知するか
検知はもはや単一のチェックではありません——まとめてスコアリングされるシグナルの積み重ねです。ある層を直しても別の層が正体を明かす、これこそ「working」なスクレイパーが突然403を返すようになる最も一般的な理由です。
| シグナル | 仕組み | 何がそれを破るか |
|---|---|---|
| TLS フィンガープリント(JA3 → JA4) | あなたの TLS ハンドシェイクをハッシュ化します。素の HTTP クライアントのハンドシェイクは、その User-Agent が主張するブラウザと一致しません——いわば「wrong-shape Chrome」です。JA4 はいまや Cloudflare、Akamai、AWS WAF で使われています。 | 本物のブラウザのハンドシェイクを再生する TLS なりすましスタック(curl-impersonate、curl-cffi、utls)と、UA に一致するヘッダー。 |
| HTTP/2 フィンガープリント | フレーム設定、ヘッダー順序、擬似ヘッダー順序が TLS 層と並べてスコアリングされます。 | 本物のブラウザ自動化、あるいはブラウザのフレーム設定とヘッダー順序を模倣する HTTP/2 クライアント。 |
| IP レピュテーション | システムは IP のネットワークを分類します。datacenter/商用=低信頼、residential/モバイル/ISP=高信頼。datacenter の IP は保護されたサイトで40–60%の成功率なのに対し、residential は90%以上です。 | まともなローテーションを伴う residential・モバイル・ISP プロキシ。焼けた datacenter レンジは避けます。 |
| ブラウザフィンガープリント | 隠しの canvas/WebGL シーンをレンダリングしてハッシュ化します。ヘッドレスのレンダリングは異なるハッシュを生みます。フォント、オーディオ、ハードウェアがエントロピーを加えます。 | GPU アクセラレーションと、一貫して異常のないフィンガープリントを備えた本物の Chromium。 |
| ヘッドレス & CDP 検知 | ヘッドレス Chrome は navigator.webdriver をセットし、プラグイン/コーデックを欠き、DevTools プロトコルの制御アーティファクトを漏らします。 | webdriver とヘッドレスの手がかりに対するステルスパッチに加え、CDP を漏らさないドライバー——最も多くチェックされる層です。 |
| 行動分析 | マウスの軌跡、スクロールのリズム、リクエスト間のタイミングが ML モデルに入力されます。API 層ではパッチできません。 | 人間らしいペース、ランダム化した遅延、低いリクエストレート。 |
| robots.txt/UA ルール | 名前付き User-Agent の disallow ルール(GPTBot、CCBot、ClaudeBot)。エッジでの適用が増えています。 | 必要な場所では尊重し、正直な UA を提示して、許可されたデータのみを収集します。 |
肝心なのは、孤立した偽装は失敗するという点です。TLS の形が食い違う residential IP や、ロボット的なタイミングのステルスブラウザは、それでも相関に引っかかります。ベンダーはリクエスト全体をスコアリングするため、回避は全体的でなければなりません——だからこそ多くのチームは、すべてを自前で維持するのではなく、難しいターゲットをマネージドなアンブロッカー経由でルーティングするのです。
壁を作っているのは誰か
- Cloudflare Bot Management + Turnstile — 圧倒的に最も多くデプロイされ、エッジベースで、JA4 スコアリングとおなじみの「Just a moment」チャレンジを備えます。AI クローラーに関するルールメーカーでもあります(後述)。
- DataDome — アプリケーション層、リアルタイム ML。強力な行動およびフィンガープリントのセンサー。生の数では珍しいものの、高い技術力を要します。
- HUMAN(旧 PerimeterX) — 高度な行動分析で、アンチボットとアンチ不正を統合。エンタープライズ向け。
- Akamai Bot Manager — エンタープライズかつエッジ。トラフィックのヘッドで最も強く、テールに向けて薄くなります。
- Kasada — 頻繁にローテーションされる難読化されたクライアントサイドのチャレンジにより、ヘッドレスとエミュレーションに対する最大の耐性を持ちます。
デプロイの仕方はベンダーと同じくらい重要です。エッジ型のシステム(Cloudflare、Akamai)は、リクエストがオリジンに届く前にブロックします。アプリケーション層型のシステム(DataDome、HUMAN)はビジネス上の文脈を見て、後からロジックを適用します。
2026年の変化:AI クローラーをブロックする
今年の大きな変化は新しいフィンガープリントではありません——壁が誰を狙っているか、です。Cloudflare Radar によれば、自動化されたリクエストは2026年にウェブトラフィックの多数派になりました(57.5% 対 人間 42.5%)。そして AI クローラーはその大きく増え続ける一部です。パブリッシャーはこう応じました。
- トップ1Mの9.33%が、いまや少なくとも1つの主要な AI クローラーを robots.txt で完全にブロックしています——robots.txt を公開しているサイトに限れば14.8%です。これはカテゴリーごとに集中しています。**ニュース & メディアのサイトの80.6%**が AI クローラーをブロックするのに対し、E コマースは約11%です。最も多くブロックされているのは GPTBot と CCBot で、ほぼ並んでいます。(完全な内訳と公開データセットは私たちの AI クローラーブロッキング指数をご覧ください。)
- Cloudflare は、2026年9月15日から AI の学習およびエージェントのクローラーをデフォルトでブロックすると発表しました——収益化されたサイトが対象で、ボットを目的別(学習 対 検索 対 エージェント)に分け、それぞれを独立して制御できるようにし、パブリッシャーが HTTP 402 レスポンスでクローラーに課金できる「pay-per-crawl」マーケットプレイスの上に構築します。
ウェブデータの上に何かを築くすべての人にとっての要点は、技術的な壁が変わらない場所でさえ許可の層が硬化しているということです——AI やエージェントのトラフィックには、ただ機能するフィンガープリントだけでなく、明示的で正直なアクセス経路がますます必要になっています。
正当なスクレイピングで今も通用する手法
アンチボットシステムは不正を止めるために作られており、公開データを収集不可能にするためではありません。正当で、レートを尊重する収集にとって、2026年に成功率を実際に動かすのは次のものです。
- residential/モバイル/ISP プロキシ — 単独で最大のレバー。IP の信頼を「datacenter」から「residential」へ移します(保護されたサイトで40–60% → 90%以上)。ローテーションは節度をもって。
- TLS なりすまし — curl-impersonate、curl-cffi、utls で本物のブラウザの JA4/HTTP-2 フィンガープリントに合わせ、提示する UA と整合するヘッダーを添えます。
- 本物のブラウザ自動化(GPU アクセラレーションとステルスパッチ付き)— 本当にブラウザを必要とする約15%のサイトに必要です。
- 人間らしいペース — ランダム化したタイミングと低いリクエストレートは、偽装では破れない行動の層を破ります。
- 難しいターゲットはマネージドなスクレイピング API/アンブロッカー経由でルーティングする — 上記すべてを組み合わせ、ベンダーの変化に適応するため、ある層の食い違いがリクエストを台無しにしません。
その最後の選択肢こそ Crawlora 自身のアプローチです。1つのエンドポイントの背後でプロキシ、フィンガープリント、レンダリング、ペースを扱い、そして——課金は成功時払い(pay-on-success)なので——壁が勝ったときではなく、リクエストが実際にデータを返したときにのみ課金されます。自分でそのどれかを作り始める前に、何を相手にしているのか確かめましょう。
出典
どこで役立つか
どんなサイトも数秒で、無料でチェック: Anti-Bot Checkerはターゲットがボットをブロックするか、どうブロックするかを教えてくれ、AI-Crawler Access Checkerはサイトが AI クローラーに何を許可しているかを示します——登録は不要です。
ターゲットが何を動かしているか分かれば、実務的な問いはそれをどう収集するかです。この問題の最も一般的な形についてはなぜスクレイパーはローカルでは動くのにサーバーでは403を返すのかを、難しいターゲットのルーティングについてはウェブスクレイピング API の選び方を、そしてこの記事の裏にある完全なデータについてはAnti-Bot IndexとAI-Crawler Blocking Indexをご覧ください。
よくある質問
アンチボット保護を使っているウェブサイトは何パーセントですか?
Crawlora による Tranco のトップ1,000,000サイトのスキャンでは、到達可能なサイトの53.5%がマネージド型のアンチボットの壁を運用しています。Cloudflare だけで全サイトの約45%——保護されたサイトのおよそ84%——の前面に立ち、大きく離れて Google reCAPTCHA(7.5%)、hCaptcha(3.5%)、そして Akamai や DataDome のようなエンタープライズ向けベンダーが続きます。保護はロングテールほど手厚く(トップ1,000の44%に対しテールは54%)、ホームページから受ける印象より深いものです。
ウェブサイトはどうやってウェブスクレイパーを検知しますか?
単一のチェックではなく、複数のシグナルをまとめてスコアリングすることによってです。TLS/JA4 と HTTP/2 のフィンガープリント(あなたのハンドシェイクは User-Agent が主張するブラウザと一致しません)、IP レピュテーション(datacenter の IP は residential に比べて低信頼)、ブラウザおよびヘッドレスのフィンガープリント(canvas/WebGL、navigator.webdriver、CDP アーティファクト)、そして行動モデル(マウスとタイミングのパターン)です。シグナルは相関しているため、ある層を偽装しても別の層が食い違えば、リクエストにはやはりフラグが立ちます。
Cloudflare に保護されたウェブサイトはどうやってスクレイピングしますか?
正当で、レートを尊重する収集のために:residential またはモバイルのプロキシを使い(IP の信頼を datacenter から residential へ移し、保護されたサイトでの成功率を約40–60%から90%以上へ引き上げます)、本物のブラウザの TLS/HTTP-2 フィンガープリントになりすまし(curl-impersonate、curl-cffi、utls)、行動検知を破るためにリクエストのペースを調整し、ブラウザを必要とする約15%のサイトには本物のブラウザを使います。多くのチームは、これらすべてを組み合わせてベンダーの変化に適応するマネージドなスクレイピング API 経由で難しいターゲットをルーティングします。