Tony Wang18 min de lecturaCloudflare rastreará la web por ti. No entra en el 29% de sus propios clientes.
Cruzamos dos censos del top 1M: el 12,8% del top 100.000 está cerrado para /crawl de Cloudflare, y el 29,1% de su propio territorio.
El endpoint /crawl de Cloudflare rastreará un sitio entero por ti, y por diseño juega limpio: es, en palabras de Cloudflare, "un bot verificado (agente intermediario) que respeta robots.txt y AI Crawl Control por defecto". Cruzamos nuestro censo anti-bot del top 1M con nuestro censo de robots.txt del top 1M —818.614 sitios alcanzables, ambos conjuntos de datos abiertos, un cruce exacto dominio por dominio— para medir cuánto le cuesta esa cortesía. Un sitio situado detrás de Cloudflare tiene 2,6 veces más probabilidades de estar cerrado para el propio crawler de Cloudflare que un sitio que no lo está: 29,1% frente a 11,3%. En 60.528 de esos sitios, la propia gestión de bots de Cloudflare nos desafió activamente. A escala web, el 12,8% de los 100.000 sitios principales está cerrado para él.
Dos puertas, no una
Casi todo lo escrito sobre /crawl desde su lanzamiento el 10 de marzo de 2026 ha enmarcado el límite como un problema anti-bot: cuánta parte de la web tiene un muro que lo detiene. Ese enfoque es incorrecto, y lo es de una forma fácil de pasar por alto.
El crawler de Cloudflare se identifica como CloudflareBrowserRenderingCrawler/1.0, y el user agent no es personalizable para /crawl. No sortea "CAPTCHAs, desafíos de Turnstile ni ningún otro mecanismo de protección contra bots", y Cloudflare confirma que las peticiones de Browser Run "siempre se identifican como tráfico de bots". Así que un sitio está cerrado para él si cualquiera de dos puertas independientes está cerrada:
- La puerta técnica — el sitio desafió o bloqueó activamente nuestra sonda. Es la definición ya publicada en nuestro Anti-Bot Adoption Index: un muro de proveedor con huella digital más aplicación activa.
- La puerta de política — robots.txt lleva
User-agent: */Disallow: /. Esto no es nuestra aproximación de lo que detiene al crawler de Cloudflare. Es la regla exacta que la propia documentación de Cloudflare indica a los propietarios de sitios que usen, describiéndola como "la configuración más restrictiva", una que "bloquea a todos los bots que cumplen las reglas, no solo a Browser Run".
Las dos puertas miden cosas distintas y —esto es lo que importa— apenas se solapan. Contar solo los muros hace que se te escape el 44,9% de la web cerrada; contar solo robots.txt hace que se te escape el 53,3%.
Show the flows
| Alcanzable → Abierto a /crawl | 673,753 (69.9%) |
| Alcanzable → Cerrado | 144,861 (15%) |
| Cerrado → Solo puerta técnica | 77,214 (8%) |
| Cerrado → Solo puerta de política | 65,026 (6.7%) |
| Cerrado → Ambas puertas | 2,621 (0.3%) |
Mostrar la tabla de las dos puertas (recuentos y % de alcanzables)
| Puerta | Sitios | % de alcanzables |
|---|---|---|
| Solo puerta de política (robots.txt dice no; sin muro) | 65,026 | 7.94% |
| Solo puerta técnica (desafiado activamente; sin disallow total) | 77,214 | 9.43% |
| Ambas puertas | 2,621 | 0.32% |
| Unión — cerrado para /crawl | 144,861 | 17.70% |
| Abierto en ambos ejes | 673,753 | 82.30% |
La cifra con la que no vamos a abrir
Ese 17,70% es literalmente cierto, y es la cifra que este estudio estaba destinado a producir. No abrimos con ella porque no creemos que signifique lo que un lector asumiría que significa.
Divide la puerta de política por rango Tranco y se comporta de forma extraña. La puerta técnica es casi plana desde la cabeza de la web hasta la cola —en torno al 10% en todas partes. La puerta de política se hunde en la mitad del ranking y luego se triplica en la cola.
Desglosa ese pico de la cola por dominio de nivel superior y deja de parecer un comportamiento de editores:
| TLD | Top 1.000 | 1k–10k | 10k–100k | 100k–1M |
|---|---|---|---|---|
| .us | — | 0.0% | 4.7% | 78.2% |
| .nl | — | 0.0% | 1.5% | 40.8% |
| .uk | 0.0% | 7.3% | 1.1% | 39.2% |
| .ca | 0.0% | 0.0% | 1.3% | 39.1% |
| .xyz | — | 12.5% | 2.4% | 23.4% |
| .se | — | 0.0% | 1.1% | 17.2% |
| .de | 0.0% | 1.4% | 1.7% | 17.7% |
| .com | 7.0% | 2.9% | 3.2% | 7.4% |
| .net | 12.5% | 5.9% | 3.7% | 4.5% |
| .ru | 14.3% | 2.4% | 3.2% | 3.0% |
| .org | 0.0% | 1.5% | 1.9% | 2.3% |
| .br | 0.0% | 1.0% | 2.2% | 1.9% |
.com, .org, .net, .ru y .br son planos en todo el ranking, que es el aspecto que tiene una decisión editorial genuina. .us pasa de 4,7% a 78,2% en un único salto de rango. .nl, .uk y .ca saltan por un factor de treinta en el mismo punto.
Basta con muestrear esos dominios para explicarlo de un vistazo. Están generados combinatoriamente: brightblackjacklounge.nl, clearroulettedaily.nl, coreslotspro.nl, betrixslots.co.uk, blogculturehub.co.uk, smartpalace883.com. Redes de apuestas y SEO registradas en masa, construidas a partir de una plantilla compartida, y la plantilla incluye un Disallow: / total. Sus archivos robots.txt son reales —todos devolvieron HTTP 200— pero codifican un valor por defecto de hosting, no la decisión de un editor sobre quién puede leer su trabajo.
Así que reportamos tres cifras y abrimos con la más conservadora:
| Universo | Sitios | Puerta de política | Puerta técnica | Cerrado para /crawl |
|---|---|---|---|---|
| Todo el top 1M alcanzable (bruto) | 818,614 | 8.26% | 9.75% | 17.70% |
| Excluyendo los seis ccTLD afectados | 753,939 | 5.57% | 9.51% | 14.74% |
| Top 100.000 (ningún TLD muestra la anomalía) | 81,577 | 2.96% | 10.21% | 12.79% |
El 12,8% de los 100.000 sitios principales está cerrado para el crawler de Cloudflare. Esa es la cifra que vamos a defender. Usa un universo estándar sin exclusiones ad hoc, y es el único lugar donde cada TLD se comporta de forma consistente. Es además la más pequeña de las tres, que es la dirección correcta para una cifra publicada por una empresa que vende la alternativa.
La víctima de esa corrección es un hallazgo que nos gustaba. En los datos brutos del top 1M, los sitios con disallow total tienen menos probabilidad de desafiar activamente (3,9% frente a 10,3%) —una historia bonita sobre que el cartel y el guardia son sustitutos, sitios que ponen un aviso en lugar de un muro. Es un artefacto. Restringe al top 100.000 y la correlación se invierte: los sitios que dicen no en robots.txt tienen ligeramente más probabilidad de desafiar también (un aumento de 1,26×, frente a 0,40× en los datos brutos). Lo reportamos porque lo buscamos y no estaba ahí.
El propio terreno de Cloudflare es su peor territorio
Cloudflare protege 369.775 sitios alcanzables en nuestro censo —45,2%, con diferencia el mayor territorio anti-bot de la web. (Eso agrupa el WAF de Cloudflare con Turnstile; el WAF solo es el 45,0% publicado en el índice.) Su crawler rinde peor exactamente ahí.
369,775 sitios — cerrados para el propio crawler de Cloudflare
448,839 sitios
Ambas puertas empujan en la misma dirección. Los sitios protegidos por Cloudflare desafían activamente en un 16,4% y llevan disallow total en un 13,2%; el resto de la web hace 7,8% y 4,2%. Y la brecha no es un artefacto de la cola —se mantiene entre 1,76× y 1,84× en cada banda por encima del rango 100k, donde la contaminación de redes de dominios está ausente.
Mostrar la tabla Cloudflare frente al resto, por banda de rango
| Banda de rango | Sitios CF | CF cerrados | Sitios no-CF | No-CF cerrados | Ratio |
|---|---|---|---|---|---|
| Top 1,000 | 175 | 25.71% | 565 | 14.34% | 1.79× |
| 1k–10k | 2,492 | 20.99% | 4,807 | 11.90% | 1.76× |
| 10k–100k | 29,690 | 19.83% | 43,848 | 10.77% | 1.84× |
| 100k–1M | 337,418 | 30.03% | 399,619 | 11.39% | 2.64× |
| Todos los alcanzables | 369,775 | 29.14% | 448,839 | 11.34% | 2.57× |
El mecanismo no es misterioso, y en realidad no tiene que ver con el muro. Es selección. Cloudflare vendió defensa anti-bot a la población de sitios menos dispuesta a ser rastreada, y ahora vende un crawler que respeta sus deseos. El producto es estructuralmente más débil precisamente en su propia base de clientes.
La versión literal de eso: 60.528 sitios usan gestión de bots de Cloudflare que desafía activamente al crawler de Cloudflare.
Vale la pena ser justos con Cloudflare aquí, porque la lectura obvia es la incorrecta. No está bloqueando su propio crawler en nombre de los clientes: su FAQ señala que Cloudflare "no aplica la protección contra bots por defecto — esa es la elección del cliente", y el 83,6% de sus sitios protegidos sí dejó pasar nuestra petición sencilla de forma pasiva. La empresa entregó el muro y lo dejó apagado. Sus clientes lo encendieron.
Mostrar la postura de aplicación de Cloudflare en sus 369.775 sitios protegidos
| Postura | Sitios | % de protegidos por Cloudflare |
|---|---|---|
| Borde pasivo (muro presente, nos dejó pasar) | 309,247 | 83.63% |
| Desafío activo | 44,177 | 11.95% |
| Bloqueo activo | 16,351 | 4.42% |
| Activo total | 60,528 | 16.37% |
| Disallow total en robots.txt | 48,926 | 13.23% |
| Cerrado para /crawl (cualquiera de las puertas) | 107,770 | 29.14% |
La trampa de la lista blanca de Enterprise
Supón que eres cliente de Cloudflare y quieres que el crawler de Cloudflare lea tu propio sitio —estás construyendo un índice RAG sobre tu propia documentación, por ejemplo. Eres uno de los 60.528. La propia FAQ de Browser Run de Cloudflare responde esto directamente: poner Browser Run en lista blanca necesita una regla personalizada de WAF, y "debes estar en un plan Enterprise para poner Browser Run en lista blanca en tu propio sitio web porque las reglas personalizadas de WAF requieren acceso a los campos de Bot Management".
Tampoco hay escapatoria por el lado del solicitante. No hay ningún parámetro para ignorar robots.txt, el user agent no se puede sobrescribir para /crawl, y las peticiones llevan una cabecera Signature-agent bajo Web Bot Auth, así que son atribuibles criptográficamente. El cumplimiento realmente no se puede evitar —lo cual es una virtud de diseño, no un defecto.
Pero significa que un cliente Free, Pro o Business de Cloudflare no tiene ninguna forma soportada de dejar pasar al crawler de Cloudflare a través del muro de Cloudflare en su propio sitio web. Cloudflare se sienta en ambos lados de la transacción, y la solución de autoservicio solo existe en el nivel más alto.
Dos años bloqueando GPTBot no compraron nada aquí
El 11,12% de los sitios alcanzables (91.020) bloquea al menos un crawler de IA nombrado —GPTBot, CCBot, ClaudeBot y el resto de la lista que la web ha pasado dos años aprendiendo a añadir. Nada de eso vincula al crawler de Cloudflare. CloudflareBrowserRenderingCrawler no está en esas listas, se lanzó en marzo de 2026, y nuestro censo de robots se ejecutó en junio. Solo el grupo * lo vincula a escala web.
Mientras tanto, el 26,58% de los sitios alcanzables (217.615) no sirve ningún robots.txt en absoluto —sin restricción de política de ningún tipo, para ningún crawler.
La política de crawlers acumulada de la web es sobre todo una lista de nombres propios, y se vuelve obsoleta en el momento en que alguien lanza un crawler nuevo.
El argumento más fuerte contra este artículo
Deberíamos plantear la objeción obvia en su forma más fuerte, porque tiene sentido.
"12,8% cerrado significa 87,2% abierto. Acabas de demostrar que el crawler de Cloudflare funciona bien para la inmensa mayoría de la web —y eres un proveedor de scraping con un motivo evidente para decir lo contrario."
Eso es justo, y la respuesta honesta es: sí. Para la mayor parte de la web, /crawl es genuinamente suficiente. Si rastreas sitios de documentación, blogs o tus propias propiedades, hará el trabajo, es barato, y durante la beta render: false no se factura en absoluto. Preferimos decir eso claramente antes que fingir lo contrario.
La afirmación que vale la pena defender es más estrecha y sobrevive a la objeción: la parte cerrada no está distribuida al azar. Se concentra en los propios clientes de Cloudflare (29,1% frente a 11,3%), y se concentra en sitios que tomaron la decisión deliberada de defenderse. Los sitios que se defienden son desproporcionadamente los que tienen datos que vale la pena defender —marketplaces, inmobiliarias, foros, clasificados. En nuestros datos de dificultad por categoría, esas cuatro están en lo más alto del ranking de dificultad. El sitio promedio está abierto. El sitio que realmente querías es más probable que no lo esté.
Hay una corroboración independiente, y no es nuestra. Cuando The Web Scraping Club probó /crawl a mano contra un conjunto de sitios protegidos por WAF en mayo de 2026, falló contra todos ellos, entre distintos proveedores. Es una muestra pequeña y la citamos como tal —pero es consistente con el mecanismo, ya que un user agent fijo, que se identifica a sí mismo y no falsificable es lo más fácil posible sobre lo que cualquier proveedor puede filtrar. Nosotros no hemos ejecutado /crawl contra una matriz de proveedores, y no afirmamos haberlo hecho.
Una segunda objeción: robots.txt es orientativo, así que esto mide cortesía en lugar de capacidad. Cierto —Cloudflare lo dice ella misma, señalando que el estándar "es un protocolo voluntario" que solo siguen los bots bien educados. Pero ese es el punto, no un defecto. Toda la propuesta de valor de /crawl es que es el educado. Para un crawler cuyo argumento de venta es el cumplimiento, una puerta orientativa es una puerta dura.
Lo que no pudimos medir
Cuatro huecos honestos, todos empujando en la misma dirección —nuestra cifra es un suelo.
-
star_disallow_rootsolo capta bloqueos de sitio completo. Las líneasDisallow:con ámbito de ruta bajo*—/search,/cart,/admin,/api— vinculan al crawler de Cloudflare página por página y no se cuentan en absoluto. La proporción de contenido que no va a obtener es materialmente mayor que la proporción de sitios en los que no va a entrar. -
AI Crawl Control es invisible para nosotros. Es un interruptor del lado del edge; ningún escaneo externo de robots.txt puede verlo. Se aplica específicamente a los sitios protegidos por Cloudflare, así que hace que el 29,1% sea una subestimación. El anuncio del 1 de julio de 2026 de Cloudflare —que a partir del 15 de septiembre pondrá por defecto en los nuevos dominios con publicidad el bloqueo de las categorías Agent y Training, y que ya "no considera a Verified como 'permitido por defecto'"— moverá esta cifra en una dirección que no podemos observar. Cubrimos ese cambio por separado.
Hay una pregunta abierta debajo de esto que no pudimos cerrar. Los casos de uso que Cloudflare promociona para
/crawlson bases de conocimiento, RAG y entrenamiento de sistemas de IA, lo que se lee como Training o Agent en lugar de Search. Si su propio crawler se clasifica así, entonces a partir del 15 de septiembre los valores por defecto de Cloudflare empezarían a bloquear al crawler de Cloudflare en los nuevos dominios de clientes con publicidad. Cloudflare no ha publicado dónde clasifica aCloudflareBrowserRenderingCrawler, y el directorio BotBase que lo diría es un panel solo para Enterprise —así que esta es la pregunta que le haríamos a Cloudflare, no un hallazgo. -
Content Signals no se mide. Nuestro escáner no analiza líneas
Content-Signal:, y el robots.txt gestionado por Cloudflare ahora incluyeai-train=nopor defecto. -
Nivel de página de inicio, punto de vista de centro de datos, dos escaneos separados por seis días (anti-bot 2026-06-14, robots 2026-06-20). Las páginas profundas están más amuralladas que las páginas de inicio —48,4% frente a 40,5% en nuestro censo de páginas profundas— así que la puerta técnica también es un suelo.
Y un conflicto de interés, dicho con claridad: vendemos una API que llega a sitios a los que el crawler de Cloudflare no llega. Precisamente por eso ambos conjuntos de datos subyacentes son abiertos, el cruce es un inner join sobre una lista semilla compartida, y el script de reproducción está incluido en el repositorio junto a este artículo. Recalcúlalo y dinos si nos equivocamos.
Dónde deja esto a /crawl
Es un buen producto con una restricción honesta. Si tus objetivos están abiertos —y la mayoría lo están— úsalo. Es un crawler verificado y bien educado con límites generosos: 100.000 páginas por trabajo, siete días de tiempo de ejecución, salida en HTML, Markdown o JSON, un retraso por defecto de 0,5 segundos que respeta Crawl-delay.
Si tus objetivos están en la parte defendida de la web, su cumplimiento no es un ajuste que puedas cambiar, y el remedio en la propia red de Cloudflare cuesta un plan Enterprise. Ahí es donde una API de desbloqueo gestionada es una herramienta diferente en lugar de una competidora.
Se siguen tres cosas si estás eligiendo un crawler:
- Comprueba la puerta de política, no solo el muro. Una comprobación anti-bot apenas responde a la mitad de la pregunta. Un sitio puede devolver un
200limpio y seguir estando vedado para cualquier cosa que lea robots.txt. - Sabe qué tipo de crawler estás ejecutando. Un crawler que cumple las normas y uno resiliente fallan en sitios distintos, y estos datos dicen que esos conjuntos se solapan mucho menos de lo que imaginarías. Elegir entre ellos es una decisión de política, no técnica.
- Las dos preguntas son separables. Puedes comprobar el muro de cualquier URL con nuestro comprobador anti-bot gratuito, y el panorama completo de robots.txt en el AI-Crawler Blocking Index.
Alcanza el 12,8%
La API de Crawlora gestiona el transporte, el fingerprinting y la capa de acceso para datos públicos en sitios que desafían a un crawler educado — con los mismos conjuntos de datos abiertos que hay detrás de este estudio.
Método
Dos censos, un inner join por dominio registrable, restringido a los sitios que alcanzó el escaneo anti-bot.
- Censo anti-bot — run
top1m-20260614, 998.497 sitios escaneados del top 1M de Tranco, 818.614 alcanzables. Conjunto de datos abierto:anti-bot-adoption-index-data(CC BY 4.0). Puerta técnica =protected == trueyenforcement ∈ {active_block, active_challenge}—la definición publicada en /anti-bot-index. - Censo de robots — run
aicrawler-top1m-20260620, misma lista semilla. Conjunto de datos abierto:ai-crawler-blocking-index-data(CC BY 4.0). Puerta de política =star_disallow_root. - La cobertura del cruce es del 100% —los 818.614 dominios alcanzables están presentes en ambos. El cruce reproduce exactamente las cifras anti-bot publicadas (818.614 alcanzables, 437.857 amurallados, 79.835 desafiados activamente, Cloudflare con 45,0% de presencia y 16,4% de tasa activa), que es la comprobación de que ambos conjuntos de datos están indexados de la misma forma.
- Una nota de definición. La comparación Cloudflare frente al resto cuenta la aplicación activa incluso donde no se pudo identificar la huella de ningún proveedor. La definición más estricta publicada requiere una huella de proveedor, que un sitio con Cloudflare siempre tiene y uno sin Cloudflare puede que no —usarla habría inflado el ratio a 3,5× en lugar de 2,6×. Reportamos la cifra más baja.
Ambos conjuntos de datos son públicos y CC BY 4.0, y el cruce es una sola pasada sobre cada archivo (unos 39 MB de descarga):
python3 scripts/anti-bot-index/cloudflare-crawl-coverage.py --data data --json figures.json
Imprime todas las tablas de este artículo, incluido el bloque de validación que reproduce las cifras anti-bot publicadas. Cítalo como "Crawlora Anti-Bot Adoption Index" con un enlace.
Lecturas relacionadas
- How Much of the Web Runs Anti-Bot? We Scanned the Top 1,000,000 Sites — la puerta técnica al completo.
- El Anti-Bot Adoption Index — buscable, todos los sitios, filtrable por proveedor y dificultad.
- El AI-Crawler Blocking Index — la puerta de política: quién bloquea a GPTBot, CCBot y ClaudeBot por nombre.
- Cloudflare bloquea crawlers de IA por defecto en 2026 — el cambio del 15 de septiembre de AI Crawl Control, que ningún censo puede ver.
- Scraping en sitios que bloquean bots — lo que realmente hace cada proveedor.
Preguntas frecuentes
¿Qué proporción de la web puede rastrear realmente el endpoint /crawl de Cloudflare?
De los 100.000 sitios principales, el 12,8% está cerrado para él — 10,2% detrás de un muro anti-bot que desafía activamente la petición, y 3,0% mediante un Disallow: / total en robots.txt, que el crawler de Cloudflare respeta por diseño. En todo el top 1M alcanzable, la cifra bruta es 17,7%, pero ese dato está inflado por redes de spam de dominios registrados en masa en la cola de Tranco que sirven un robots.txt de plantilla. Por eso reportamos la cifra del top 100k como la defendible.
¿Por qué no basta un escaneo anti-bot solo para responder esta pregunta?
Porque el crawler de Cloudflare está limitado por dos puertas independientes, no por una. Un escaneo anti-bot solo ve la puerta técnica — si un sitio desafía la petición. La puerta de política, un Disallow: / total en robots.txt, le queda oculta, aunque detiene a un crawler que cumple las normas en un sitio técnicamente abierto de par en par. En el top 1M alcanzable, 65.026 sitios están cerrados solo por robots.txt, y cualquier medición anti-bot los contaría como abiertos.
¿Se bloquea con más frecuencia al crawler de Cloudflare en sitios que usan Cloudflare?
Sí, por un factor de aproximadamente 2,6. De los 369.775 sitios alcanzables detrás de Cloudflare, el 29,1% está cerrado para el propio endpoint /crawl de Cloudflare, frente al 11,3% de los 448.839 sitios que no están detrás de Cloudflare. La brecha se mantiene entre 1,76× y 1,84× en cada banda de rango por encima de 100k. En 60.528 sitios, la gestión de bots de Cloudflare desafió activamente al propio crawler de Cloudflare.
¿Se puede hacer que el endpoint /crawl de Cloudflare ignore robots.txt?
No. No hay ningún parámetro para ignorar robots.txt, el user agent (CloudflareBrowserRenderingCrawler/1.0) no se puede sobrescribir para /crawl, y las peticiones llevan una cabecera Signature-agent bajo Web Bot Auth, por lo que son atribuibles criptográficamente. El propietario de un sitio sí puede ponerlo en lista blanca — pero, según la FAQ de Browser Run de Cloudflare, poner Browser Run en lista blanca en tu propio sitio web requiere una regla personalizada de WAF y, por tanto, un plan Enterprise.
¿Bloquear a GPTBot o CCBot en robots.txt también bloquea al crawler de Cloudflare?
No. El 11,12% de los sitios alcanzables del top 1M (91.020) bloquea al menos un crawler de IA nombrado, pero CloudflareBrowserRenderingCrawler no está en ninguna de esas listas — se lanzó apenas en marzo de 2026. A escala web, solo el grupo User-agent: * lo vincula. De forma independiente, el 26,58% de los sitios alcanzables (217.615) no sirve ningún robots.txt en absoluto.
¿Cómo bloqueo al crawler de Cloudflare en mi sitio?
Cloudflare documenta tres opciones de robots.txt. Un 'User-agent: * / Disallow: /' total bloquea a todos los bots que cumplen las normas, incluido Browser Run. Para bloquear solo el endpoint de crawl, nombra 'User-agent: CloudflareBrowserRenderingCrawler' con 'Disallow: /' y permite todo lo demás. Para zonas concretas, da al mismo user agent líneas Disallow con ámbito de ruta. Como robots.txt es orientativo — Cloudflare lo llama un protocolo voluntario que solo siguen los bots bien educados — la aplicación real necesita una regla de WAF; la referencia de Cloudflare documenta el ID de detección de bots 128292352 para el endpoint de crawl, separado del 119853733 para Quick Actions, Puppeteer, Playwright y CDP.
¿El endpoint /crawl de Cloudflare respeta robots.txt?
Sí, por diseño y sin posibilidad de anularlo desde el lado del solicitante. El changelog de Cloudflare sobre el lanzamiento del 10 de marzo de 2026 describe el endpoint como un bot verificado (agente intermediario) que respeta robots.txt y AI Crawl Control por defecto. Respeta Crawl-delay, envía un user agent fijo CloudflareBrowserRenderingCrawler/1.0 que no es personalizable para /crawl, adjunta una cabecera Signature-agent bajo Web Bot Auth de forma que las peticiones son atribuibles criptográficamente, y, según la documentación de Cloudflare, no sortea CAPTCHAs, desafíos de Turnstile ni otros mecanismos de protección contra bots.