Tony Wang8 min de lecturaCloudflare bloquea a los AI crawlers por defecto en 2026: qué cambió y qué hacer
Cloudflare bloqueará por defecto AI Agent/Training en páginas con publicidad desde el 15 sept. 2026 — qué cambió y cómo seguir scrapeando.
Cloudflare está delante de aproximadamente una quinta parte del web. El 1 de julio de 2026 anunció el siguiente paso de una política que había iniciado un año antes: los AI crawlers ya no reciben un simple «bloquear o permitir» — se clasifican en categorías, y dos de las tres ahora quedan bloqueadas por defecto en las páginas que le generan dinero a un sitio.
Si administras cualquier tipo de scraper, pipeline de datos o AI agent que toque el web abierto, vale la pena entender esto — no porque apunte específicamente al scraping malicioso, sino porque los nuevos valores por defecto no distinguen entre «empresa de AI entrenando un modelo» y «desarrollador con un trabajo legítimo de research o monitoreo», a menos que puedas demostrar cuál de los dos eres.
Qué cambió realmente
El post de Cloudflare — Content Independence Day: the next chapter — divide el tráfico de AI bots en tres categorías, cada una con una definición precisa:
- Search — «cualquier comportamiento que recolecta o indexa tu contenido, para poder responder preguntas sobre él más adelante». El trato clásico: se construye un índice, el sitio recibe tráfico de referencia a cambio. Sigue permitido por defecto.
- Agent — «comportamiento automatizado que actúa, normalmente en tiempo real, en nombre de una persona, para conseguir algo ahora mismo» — un fetch al estilo ChatGPT-User, o un agente que usa el navegador como Gemini o Claude operando a nombre de alguien en medio de una sesión.
- Training — un crawler que toma contenido para entrenar o hacer fine-tuning de un modelo, donde «tus datos quedan absorbidos permanentemente en la arquitectura subyacente» en lugar de referenciarse de forma transitoria.
A partir del 15 de septiembre de 2026, los bots de Agent y Training quedan bloqueados por defecto en las páginas con publicidad — páginas que un propietario de sitio construyó para que las vea y monetice un visitante humano. Los bots de Search no se ven afectados. Y algo crucial: este valor por defecto se aplica a:
- dominios nuevos en Cloudflare a partir de esa fecha,
- sitios nuevos añadidos por clientes existentes, y
- cuentas del plan gratuito que no han tocado la configuración.
Los clientes de pago existentes conservan lo que ya tienen configurado — es un valor por defecto para altas nuevas, no un bloqueo retroactivo sobre todo el footprint de Cloudflare. Los crawlers multipropósito (Googlebot, Bingbot, Applebot — todos ellos ahora cumplen doble función como crawlers de search y de AI training) se rigen por la regla más restrictiva aplicable entre todas las funciones que combinan.
También hay una nueva pieza de infraestructura genuinamente útil para quien quiera expresar una preferencia de uso de datos, en vez de solo ser bloqueado o permitido como categoría: una directiva Content-Signal de robots.txt extendida, ahora incluida por defecto en el robots.txt gestionado por Cloudflare:
Content-Signal: search=yes,ai-train=no,use=reference
El nuevo parámetro use= es la adición más interesante — use=immediate («interactuar, pero no almacenar ni reutilizar nada»), use=reference (el valor por defecto — «indexar, extraer un fragmento y enlazar de vuelta»), o use=full («resumir y reproducir»). Es una preferencia declarada, no un bloqueo forzado — la aplicación ocurre en el edge de Cloudflare, no mediante el cumplimiento de robots.txt — pero es la señal pública más clara hasta ahora de cómo quieren los propietarios de sitios que se use su contenido.
Por qué Cloudflare hizo esto
El cambio técnico es pequeño; los números detrás de él explican la motivación. El informe complementario que Cloudflare publicó el mismo día, Agentic internet: one year of bot report data, expone la tendencia a la que está respondiendo:
- El 52% de las solicitudes de crawlers son ahora para AI training, frente al 22% en la primavera de 2025.
- Más de la mitad de todo el tráfico de internet ya no es humano.
- Algunas de las categorías de contenido más rastreadas han visto caer el tráfico humano hasta un 40% en menos de un año.
- Google sigue generando ~88% del tráfico de referencia y posee aproximadamente 2 veces más información que cualquier competidor de AI individual — el escenario «Google Zero» (un mundo en el que la búsqueda envía poco o ningún tráfico a los editores) es, según se reporta, para lo que se están preparando los editores.
Esto se apoya en el primer Content Independence Day de Cloudflare (1 de julio de 2025), cuando convirtió «bloquear AI bots» en el valor por defecto para dominios nuevos y lanzó Pay Per Crawl — un mecanismo HTTP 402 Payment Required en el que un crawler que no ha pagado recibe un 402 con una cabecera crawler-price, puede hacer una contraoferta o aceptar, y un fetch pagado exitoso devuelve un 200 con crawler-charged. Cloudflare actúa como merchant of record y paga a los editores mensualmente. Un año después, Cloudflare dice haber evolucionado esto hacia un marketplace Pay Per Use más amplio (con Ceramic.ai y You.com como socios de lanzamiento), aunque ni el post de Cloudflare ni la cobertura periodística revelan precios ni la comisión de Cloudflare.
También verás una cifra muy citada — «416.000 millones de solicitudes de AI bots bloqueadas» — asociada a esta noticia en parte de la cobertura. Ese número es real, pero proviene de una entrevista de diciembre de 2025 al CEO de Cloudflare, Matthew Prince, que describe los primeros seis meses tras el lanzamiento de 2025 — no una estadística del anuncio de julio de 2026 en sí. Vale la pena saberlo para no confundir qué generación de política produjo qué número.
La parte que importa si tú no eres el objetivo
El enfoque de Cloudflare apunta a empresas de AI que entrenan modelos y a agentes que solicitan páginas en piloto automático. Pero el mecanismo de aplicación no lee la intención — lee la identidad, y demostrar identidad ahora es un proceso con permisos, no una cabecera que puedas configurar tú mismo:
- Programa Verified Bot — los operadores de bots se inscriben y se comprometen a una «autorrepresentación honesta» de su identidad y propósito. Esta es la vía principal para ser reconocido como una categoría específica y confiable, en vez de quedar mezclado como tráfico no verificado.
- BotBase — un nuevo directorio público y consultable de bots y agentes conocidos, que los propietarios de sitios pueden referenciar directamente en sus propias reglas de seguridad personalizadas.
- Autodeclaración vía cabecera Forwarded (
Forwarded: for="openai";use="reference", según RFC 7239) — permite que un intermediario declare a nombre de quién actúa y por qué, habilitando una «confianza transitiva» a través de proxies o frameworks de agentes.
Nada de esto es una lista blanca estática que un scraper de terceros pueda simplemente adoptar. Si tu tráfico no está verificado individualmente y visitas un sitio nuevo en Cloudflare o una cuenta gratuita sin configurar después del 15 de septiembre, la lectura honesta es esta: tu trabajo legítimo de research, monitoreo de precios o construcción de datasets corre el riesgo de recibir el mismo bloqueo por defecto que un crawler real de AI training, a menos que respetes el Content-Signal declarado del sitio y te mantengas dentro de él, o que operes a través de una infraestructura que ya gestiona la capa de identidad por ti.
Para entender en profundidad cómo Cloudflare (y DataDome, PerimeterX/HUMAN) hacen fingerprinting y bloquean solicitudes en primer lugar — reputación de IP, fingerprinting TLS/HTTP y la capa de sensores JS — consulta scraping de sitios que bloquean bots; este post trata sobre la capa de política que se sitúa encima de eso.
Cómo seguir recolectando datos públicos
Ordenado por lo que es realista para la mayoría de los equipos:
1. Respeta el Content-Signal declarado del sitio donde puedas leerlo
Si un sitio publica ai-train=no o use=immediate, esa es una declaración explícita de intención del propietario — un scraper de buena fe debería respetarla, tanto porque es lo correcto como porque es la evidencia más clara de que no eres el tráfico al que apunta esta política.
2. Regístrate como Verified Bot si operas a escala real
Vale la pena si administras una operación de crawling grande e identificable y quieres reconocimiento de primer nivel en lugar de depender de un unblocking genérico. Es un compromiso real (autorrepresentación precisa, cumplimiento continuo), no una simple casilla — la mayoría de los equipos pequeños y los trabajos de research puntuales no alcanzarán el nivel necesario para que valga la pena el proceso.
3. Una API de unblocking gestionada (Crawlora)
Para el caso más habitual — necesitas datos públicos de sitios que cada vez más bloquean por defecto el tráfico no verificado, y no quieres construir ni mantener tú mismo la rotación de proxies, el fingerprinting y la capa de negociación de identidad — el web scraping API de Crawlora y el endpoint /web/scrape gestionan la capa de acceso detrás de una sola key:
curl -X POST "https://api.crawlora.net/api/v1/web/scrape" \
-H "x-api-key: $CRAWLORA_API_KEY" \
-H "Content-Type: application/json" \
-d '{"url": "https://example.com", "formats": ["markdown"], "render": "auto"}'
import requests
resp = requests.post(
"https://api.crawlora.net/api/v1/web/scrape",
headers={"x-api-key": "YOUR_API_KEY"},
json={"url": "https://example.com", "formats": ["markdown"], "render": "auto"},
)
print(resp.json()["data"]["markdown"][:500])
render: "auto" escala de un fetch simple a un navegador real solo cuando un sitio lo exige — el mismo patrón de escalado que hoy consigue superar Cloudflare, DataDome y PerimeterX. Esto no te da el estatus de Verified Bot; es la alternativa práctica para equipos que recolectan datos públicos a una escala demasiado pequeña para justificar su propio programa de verificación, pero lo bastante real como para que «simplemente reintentar desde otra IP» deje de funcionar.
Una nota sobre cumplimiento normativo
Nada de esto cambia las reglas subyacentes, solo eleva el nivel técnico y de identidad necesario para hacerlas cumplir. Sea cual sea la vía que tomes:
- Recolecta solo datos públicos a los que estés autorizado a acceder — el
Content-Signaly los Términos de Servicio de un sitio siguen aplicando, sin importar si técnicamente puedes superar el bloqueo. - Trata los datos personales scrapeados (nombres, reseñas, perfiles) bajo GDPR/CCPA igual que lo harías con cualquier otra fuente — minimiza lo que almacenas y ten una base legal.
- Si tu caso de uso es específicamente AI training, esta política apunta directamente a ti — el licenciamiento o una vía declarada y conforme es la respuesta duradera, no eludir un bloqueo.
Esto no es asesoría legal — consulta ¿es legal el web scraping en 2026? para el tratamiento más amplio de datos públicos frente a datos personales.
Fuentes
Dónde encaja esto
Esta es la capa de política; para la mecánica de cómo superar realmente a Cloudflare, DataDome y PerimeterX/HUMAN — las señales de fingerprinting y el patrón de escalado que funciona de forma fiable — consulta scraping de sitios que bloquean bots. Para conocer la magnitud de lo que ya está bloqueado en el web, consulta el Anti-Bot Index, el dataset abierto de Crawlora que rastrea la adopción de defensas anti-bot en los principales sitios. Para elegir un toolkit más amplio, consulta cómo elegir una web scraping API.
Pruébalo primero, gratis: procesa cualquier URL pública con el Free Web Scraper, o comprueba si un sitio bloquea bots con el Anti-Bot Checker — sin registro. Prueba el endpoint en el Playground y revisa los precios.
Preguntas frecuentes
¿Qué cambió realmente Cloudflare el 1 de julio de 2026?
Cloudflare dividió el tráfico de AI bots en tres categorías — Search, Agent y Training — y anunció que a partir del 15 de septiembre de 2026 los bots de Agent y Training quedarán bloqueados por defecto en páginas con publicidad, tanto en dominios nuevos como en sitios nuevos de clientes existentes y cuentas del plan gratuito sin configurar. Los bots de Search siguen permitidos por defecto. Los clientes de pago existentes conservan su configuración actual salvo que activen el cambio.
¿Esto bloquea todo el scraping en sitios protegidos por Cloudflare?
No. Es un valor por defecto para altas nuevas y cuentas del plan gratuito que afecta específicamente a las categorías Agent y Training en páginas monetizadas con publicidad — no es un bloqueo retroactivo a nivel de sitio para clientes de pago existentes, y el crawling de Search sigue permitido por defecto en todos los casos.
¿Cómo distingue Cloudflare a un scraper legítimo de un AI crawler bloqueado?
Sobre todo mediante identidad verificada, no por el contenido de las cabeceras: un programa Verified Bot que exige autorrepresentación honesta, un directorio público BotBase de bots conocidos, y una cabecera HTTP Forwarded autodeclarada (RFC 7239) que indica a nombre de quién actúa una solicitud. No existe una lista blanca estática de user-agents que un tercero pueda simplemente adoptar.
¿Qué es la directiva Content-Signal de robots.txt?
Una directiva que los propietarios de sitios pueden publicar (por ejemplo, Content-Signal: search=yes,ai-train=no,use=reference) para declarar cómo quieren que se use su contenido — indexado, referenciado o reproducido. Es una preferencia declarada, no un bloqueo forzado; la aplicación ocurre por separado en el edge de Cloudflare.
¿Cómo puedo seguir recolectando datos públicos después de este cambio?
Respeta el Content-Signal declarado de un sitio donde puedas leerlo, regístrate como Verified Bot si administras una operación de crawling grande e identificable, o enruta las solicitudes a través de una API de unblocking gestionada que ya gestiona la rotación de proxies y el fingerprinting para la recolección de datos públicos a menor escala.