Tony Wang7 Min. LesezeitWie Websites Web Scraping 2026 verhindern (und was noch funktioniert)
53.5% der Top-1M-Sites laufen hinter einer Anti-Bot-Wall. Wie TLS-/Browser-Fingerprinting, IP-Reputation und Cloudflare Scraper erkennen — und was durchkommt.
Die meisten Web-Scraping-Guides erklären, wie man Daten extrahiert. Dieser hier handelt von der Wall davor — denn 2026 entscheidet genau diese Wall darüber, ob dein Scraper funktioniert. Wir haben nachgezählt: In einem Scan der Tranco top 1,000,000 sites laufen 53.5% der erreichbaren hinter einem gemanagten Anti-Bot-System. Hier steht, wie diese Systeme Scraper erkennen, wer sie baut, was sich 2026 geändert hat und was legitime Erhebung noch durchbringt.
Wie verbreitet ist Anti-Bot-Schutz?
Von ~818,600 erreichbaren Sites in unserem Top-1M-Scan sitzen 437,857 — 53.5% — hinter einer gemanagten Anti-Bot-Wall. Der Markt ist außergewöhnlich konzentriert: Cloudflare sitzt vor 45% aller Sites, etwa 84% jeder geschützten Site. Alles andere ist ein Long Tail.
| Anti-Bot-Anbieter | Anteil aller Sites | Anmerkungen |
|---|---|---|
| Cloudflare | ~45% | Die dominante Wall; steigt mit der Obskurität |
| Google reCAPTCHA | 7.5% | Mit Abstand das häufigste CAPTCHA |
| hCaptcha | 3.5% | Datenschutz-positioniertes CAPTCHA |
| Cloudflare Turnstile | 1.3% | CAPTCHA-Ersatz-Widget |
| Imperva (Incapsula) | 0.6% | Ausgereifte WAF + Bot |
| Akamai Bot Manager | 0.6% | Enterprise; am stärksten am Traffic-Head |
| DataDome | 0.1% | Selten, aber anspruchsvoll, ML-getrieben |
Zwei Befunde überraschen. Erstens: Der Schutz steigt, je weiter du in den Rängen nach unten gehst — 44.2% der Top-1,000-Sites sind ummauert gegenüber 53.6% des Tails —, weil Cloudflares Free-Tier Millionen kleiner Sites verteidigt, während Enterprise-Bot-Management (Akamai) ausdünnt. Zweitens: Startseiten untertreiben es: In einer Deep-Page-Erhebung waren Produkt-, Listing- und Profilseiten zu 48.4% ummauert gegenüber 40.5% bei Startseiten und saßen weit häufiger hinter einem Login. Die Seite, die du wirklich willst, ist besser verteidigt als die Eingangstür.
Wie Websites Scraper 2026 erkennen
Erkennung ist längst keine einzelne Prüfung mehr — sie ist ein Stapel von Signalen, die gemeinsam bewertet werden. Eines zu beheben, während ein anderes dich verrät, ist der häufigste Grund, warum ein „working“-Scraper plötzlich 403er zurückgibt.
| Signal | Wie es funktioniert | Was es aushebelt |
|---|---|---|
| TLS-Fingerprinting (JA3 → JA4) | Hasht deinen TLS-Handshake. Der Handshake eines simplen HTTP-Clients passt nicht zu dem Browser, den sein User-Agent behauptet — ein „wrong-shape Chrome“. JA4 wird inzwischen von Cloudflare, Akamai und AWS WAF genutzt. | Ein TLS-Impersonation-Stack (curl-impersonate, curl-cffi, utls), der einen echten Browser-Handshake nachspielt — und Header, die zum UA passen. |
| HTTP/2-Fingerprinting | Frame-Settings, Header-Reihenfolge und Pseudo-Header-Reihenfolge werden zusammen mit der TLS-Schicht bewertet. | Echte Browser-Automation oder ein HTTP/2-Client, der die Frame-Settings und Header-Reihenfolge eines Browsers spiegelt. |
| IP-Reputation | Systeme klassifizieren das Netz der IP: Datacenter/kommerziell = geringes Vertrauen; Residential/Mobile/ISP = hohes Vertrauen. Datacenter-IPs erreichen 40–60% Erfolg auf geschützten Sites gegenüber 90%+ bei Residential. | Residential-, Mobile- oder ISP-Proxys mit vernünftiger Rotation; verbrannte Datacenter-Ranges meiden. |
| Browser-Fingerprinting | Rendert eine versteckte Canvas-/WebGL-Szene und hasht sie; Headless-Rendering erzeugt einen anderen Hash. Schriften, Audio und Hardware fügen Entropie hinzu. | Echtes Chromium mit GPU-Beschleunigung und konsistenten, nicht auffälligen Fingerprints. |
| Headless- & CDP-Erkennung | Headless Chrome setzt navigator.webdriver, hat keine Plugins/Codecs und leakt DevTools-Protocol-Steuerungsartefakte. | Stealth-Patches für den Webdriver und die Headless-Verräter plus Treiber, die kein CDP leaken — die am meisten geprüfte Schicht. |
| Verhaltensanalyse | Mausbewegungen, Scroll-Rhythmus und Timing zwischen Requests speisen ML-Modelle. Auf der API-Schicht nicht patchbar. | Menschenähnliches Tempo, randomisierte Verzögerungen und niedrige Request-Raten. |
| robots.txt-/UA-Regeln | Disallow-Regeln für benannte User-Agents (GPTBot, CCBot, ClaudeBot), zunehmend am Edge durchgesetzt. | Halte sie ein, wo nötig; präsentiere einen ehrlichen UA und erhebe nur erlaubte Daten. |
Der tragende Punkt: Isoliertes Spoofing scheitert. Eine Residential-IP mit unpassender TLS-Form oder ein gestealthter Browser mit robotischem Timing löst die Korrelation trotzdem aus. Anbieter bewerten den gesamten Request, also muss Umgehung ganzheitlich sein — genau deshalb leiten so viele Teams die harten Ziele über einen gemanagten Unblocker, statt alles selbst zu pflegen.
Wer die Walls baut
- Cloudflare Bot Management + Turnstile — mit Abstand am häufigsten eingesetzt, edge-basiert, mit JA4-Scoring und der bekannten „Just a moment“-Challenge. Zugleich der Regelsetzer bei KI-Crawlern (siehe unten).
- DataDome — Application-Layer, Echtzeit-ML; starke Verhaltens- und Fingerprint-Sensoren. In absoluten Zahlen selten, aber anspruchsvoll.
- HUMAN (früher PerimeterX) — fortgeschrittene Verhaltensanalyse, die Anti-Bot und Anti-Fraud zusammenführt; Enterprise.
- Akamai Bot Manager — Enterprise und Edge, am stärksten am Traffic-Head, dünnt zum Tail hin aus.
- Kasada — maximaler Widerstand gegen Headless und Emulation durch häufig rotierte, verschleierte clientseitige Challenges.
Das Deployment zählt so viel wie der Anbieter: Edge-Systeme (Cloudflare, Akamai) blockieren, bevor dein Request den Origin erreicht; Application-Layer-Systeme (DataDome, HUMAN) sehen den Geschäftskontext und wenden Logik danach an.
Die Verschiebung 2026: das Blockieren der KI-Crawler
Die große Änderung dieses Jahr ist kein neuer Fingerprint — es ist, auf wen die Walls zielen. Laut Cloudflare Radar wurden automatisierte Requests 2026 zur Mehrheit des Web-Traffics (57.5% vs. 42.5% menschlich), und KI-Crawler sind ein großer und wachsender Anteil davon. Publisher reagierten:
- 9.33% der Top 1M blockieren inzwischen mindestens einen großen KI-Crawler vollständig in der robots.txt — 14.8% der Sites, die überhaupt eine robots.txt veröffentlichen. Es konzentriert sich nach Kategorie: 80.6% der News- & Medien-Sites blockieren einen KI-Crawler, gegenüber ~11% im E-Commerce. GPTBot und CCBot werden am häufigsten blockiert, praktisch gleichauf. (Vollständige Aufschlüsselung und das offene Dataset: unser AI-Crawler-Blocking-Index.)
- Cloudflare hat angekündigt, ab dem 15. September 2026 KI-Trainings- und Agent-Crawler standardmäßig zu blockieren — auf monetarisierten Sites, wobei Bots nach Zweck aufgeteilt werden (Training vs. Search vs. Agent), sodass jeder unabhängig steuerbar ist, aufbauend auf dem „pay-per-crawl“-Marktplatz, über den Publisher Crawlern per HTTP 402-Response Gebühren berechnen können.
Für alle, die auf Web-Daten aufbauen, lautet die Erkenntnis: Die permission-Ebene verhärtet sich, selbst wo die technische Wall unverändert bleibt — KI- und Agent-Traffic braucht zunehmend einen expliziten, ehrlichen Zugangspfad, nicht nur einen funktionierenden Fingerprint.
Was für legitimes Scraping noch funktioniert
Anti-Bot-Systeme sind gebaut, um Missbrauch zu stoppen, nicht um öffentliche Daten unerreichbar zu machen. Für legitime, rate-schonende Erhebung sind es diese Dinge, die 2026 die Erfolgsraten wirklich bewegen:
- Residential-/Mobile-/ISP-Proxys — der mit Abstand größte Hebel, der das IP-Vertrauen von „datacenter“ zu „residential“ verschiebt (40–60% → 90%+ auf geschützten Sites). Rotiere vernünftig.
- TLS-Impersonation — triff den JA4/HTTP-2-Fingerprint eines echten Browsers mit curl-impersonate, curl-cffi oder utls, mit Headern, die zum präsentierten UA passen.
- Echte Browser-Automation mit GPU-Beschleunigung und Stealth-Patches — nötig für die ~15% der Sites, die wirklich einen Browser verlangen.
- Menschenähnliches Tempo — randomisiertes Timing und niedrige Request-Raten hebeln die Verhaltensschicht aus, die Spoofing nicht schafft.
- Leite harte Ziele über eine gemanagte Scraping-API / einen Unblocker — das kombiniert all das oben und passt sich an, wenn Anbieter sich ändern, sodass ein Mismatch in einer Schicht den Request nicht versenkt.
Diese letzte Option ist Crawloras eigener Ansatz: Es kümmert sich hinter einem Endpoint um Proxys, Fingerprints, Rendering und Tempo, und — weil die Abrechnung pay-on-success ist — zahlst du nur, wenn ein Request tatsächlich Daten zurückgibt, nicht wenn eine Wall gewinnt. Bevor du irgendetwas davon selbst baust, prüf, womit du es zu tun hast.
Quellen
Wo das hineinpasst
Prüf jede Site in Sekunden, kostenlos: Der Anti-Bot Checker sagt dir, ob ein Ziel Bots blockiert und wie, und der AI-Crawler Access Checker zeigt, was eine Site KI-Crawlern erlaubt — ohne Anmeldung.
Sobald du weißt, was ein Ziel einsetzt, ist die praktische Frage, wie man es erhebt. Siehe warum dein Scraper lokal funktioniert, aber auf einem Server 403 zurückgibt für die mit Abstand häufigste Variante dieses Problems, wie man eine Web Scraping API auswählt fürs Routing harter Ziele und den Anti-Bot Index sowie den AI-Crawler Blocking Index für die vollständigen Daten hinter diesem Beitrag.
Häufig gestellte Fragen
Wie viel Prozent der Websites nutzen Anti-Bot-Schutz?
In Crawloras Scan der Tranco-Top-1,000,000-Sites laufen 53.5% der erreichbaren hinter einer gemanagten Anti-Bot-Wall. Cloudflare allein sitzt vor etwa 45% aller Sites — rund 84% jeder geschützten Site —, gefolgt mit großem Abstand von Google reCAPTCHA (7.5%), hCaptcha (3.5%) und Enterprise-Anbietern wie Akamai und DataDome. Der Schutz ist im Long Tail dichter (44% der Top 1,000 vs. 54% des Tails) und reicht tiefer, als Startseiten vermuten lassen.
Wie erkennen Websites Web Scraper?
Indem sie mehrere Signale gemeinsam bewerten, nicht mit einer einzigen Prüfung: TLS/JA4- und HTTP/2-Fingerprinting (dein Handshake passt nicht zu dem Browser, den dein User-Agent behauptet), IP-Reputation (Datacenter-IPs sind geringes Vertrauen gegenüber Residential), Browser- und Headless-Fingerprinting (Canvas/WebGL, navigator.webdriver, CDP-Artefakte) und Verhaltensmodelle (Maus- und Timing-Muster). Weil die Signale korreliert sind, fällt ein Request auf, wenn du eine Schicht fälschst, während eine andere nicht passt.
Wie scrape ich eine von Cloudflare geschützte Website?
Für legitime, rate-schonende Erhebung: Nutze Residential- oder Mobile-Proxys (die das IP-Vertrauen von Datacenter zu Residential verschieben und den Erfolg auf geschützten Sites von ~40–60% auf 90%+ heben), imitiere den TLS/HTTP-2-Fingerprint eines echten Browsers (curl-impersonate, curl-cffi, utls), takte Requests, um die Verhaltenserkennung auszuhebeln, und setze für die ~15% der Sites, die einen Browser verlangen, einen echten Browser ein. Die meisten Teams leiten harte Ziele über eine gemanagte Scraping-API, die all das kombiniert und sich anpasst, wenn Anbieter sich ändern.