Tony Wang22 min de lecturaEl 14% de la Web Está Realmente Muerta
Solo el 14% de los 10M dominios principales está realmente muerto, no el 27.6%. Casi la mitad de lo «muerto» solo bloquea bots o da errores.
Seguro que ya has visto la cifra: el 27.6% de la web está muerta. Viene de un rastreo de 2024 de los 10 millones de dominios principales, y se repite una y otra vez porque es llamativa y algo desoladora. Nosotros hicimos ese estudio. Y cuando volvimos a escanear la misma lista de 10 millones de dominios en 2026 — esta vez separando un dominio que está realmente desaparecido de uno que simplemente rechaza a un bot — la cifra real resultó ser 14.2%.
La web no se curó de repente. La cifra original estaba contando las cosas equivocadas. Un rastreador ingenuo no puede distinguir un dominio muerto de uno vivo escondido detrás de Cloudflare, y cuenta un servidor que responde educadamente «404 Not Found» igual que uno que nunca responde. Corrige la clasificación y resulta que casi la mitad de lo «muerto» está vivo — simplemente no hablaba con un bot. Esta es la imagen completa, a partir de 9,992,781 dominios sondeados.
Cómo es en realidad el resultado de un escaneo de 10 millones de dominios
Cada dominio recibe una de cuatro etiquetas. alive significa que respondió (un 2xx, o incluso un 404/5xx — el servidor está en funcionamiento). blocked significa que respondió pero rechazó a nuestro cliente automatizado (un 403, 429, o un desafío anti-bot). redirect significa que rebotó a algún sitio que no pudimos resolver. dead significa que nunca respondió en absoluto — sin registro DNS, o nada acepta una conexión.
Tres cuartas partes de la web principal están vivas y responden. La parte interesante es el 23% inferior — la porción sobre la que todos discuten — y cómo la divides.
La cifra real: 14% muerta, no 27.6%
Misma lista, misma escala, una diferencia: en 2026 nos negamos a llamar muerto a un dominio solo porque nuestro bot no pudo leerlo. Un dominio realmente muerto falla temprano — el DNS no devuelve nada, o la conexión es rechazada. Un dominio vivo pero defendido falla tarde, con un 403 o una página de desafío, lo cual es una señal completamente distinta. Contar con honestidad mueve el titular de 27.6% a 14.2%.
Fallo de DNS, 403 anti-bot, 404/5xx servidos y tiempos de espera, todo mezclado
Sin DNS, conexión rechazada, o nada acepta una conexión
¿Adónde van los ~13 puntos que faltan? Casi todo se reduce a dos cosas que un rastreo ingenuo clasifica mal:
- El 8.9% (891,672 sitios) responde pero bloquea a los bots. Un 403, un 429, o un desafío «Just a moment» de Cloudflare a una IP de centro de datos. Estos son algunos de los sitios más vivos de la web — ejecutan defensas activas precisamente porque la gente quiere sus datos.
- ~4% sirve un 404 o 5xx desde un servidor vivo. Un «404 Not Found» o un «503 Service Unavailable» es prueba de que el host respondió. El rastreo original los contaba como muertos; un servidor que devuelve un error es lo opuesto a haber desaparecido.
El resto es un artefacto de medición de 2024: aquel rastreo resolvía cada dominio a través de un único resolutor DNS, y una consulta inestable marcaba falsamente como muertos a dominios que sí resolvían. Ahora verificamos de forma cruzada entre varios resolutores antes de declarar un fallo de DNS.
Lo que un rastreador que no sigue redirecciones hace mal
La brecha entre 27.6% y 14.2% es en gran parte una decisión de medición: si sigues las redirecciones y lees lo que el servidor realmente dice. Un rastreador que se detiene en la primera respuesta solo ve que el 45.9% devuelve un 200 limpio y da el resto por perdido. Sigue las redirecciones y lee los cuerpos de respuesta, y el 71.9% está vivo. Así es donde termina realmente cada primera respuesta:
Show the flows
| 200 OK → Vivo | 4,584,611 (46.3%) |
| Redirección 3xx → Vivo | 2,677,304 (27%) |
| Sin respuesta → Muerto | 1,413,013 (14.3%) |
| 403 / 429 → Bloqueado | 410,511 (4.1%) |
| Redirección 3xx → Bloqueado | 365,368 (3.7%) |
| 404 → Vivo | 236,685 (2.4%) |
| Sin respuesta → Bloqueado | 105,222 (1.1%) |
| 5xx → Vivo | 85,728 (0.9%) |
| Redirección 3xx → Redirección | 31,267 (0.3%) |
| Redirección 3xx → Muerto | 1,775 (0%) |
Los grandes ríos de este gráfico dejan claro el punto: un 301 no es un callejón sin salida — el 87% de las redirecciones resuelven en una página viva —, y un 403 o 429 es un sitio vivo que rechaza a un bot, no un cadáver. La única respuesta que de forma fiable significa muerto es la ausencia total de respuesta — y esa única banda Sin respuesta → Muerto es casi toda la web muerta.
La web realmente muerta es en su mayoría DNS que ha desaparecido
Entonces, ¿qué es ese 14.2%? Abrumadoramente, son dominios que han abandonado el DNS por completo. De los 1,414,788 dominios realmente muertos, 1,077,715 — alrededor del 76% — ya no resuelven a ninguna IP en absoluto. El registro caducó, la zona se eliminó, el proyecto se abandonó. El resto rechaza o reinicia cada conexión, o falla el TLS ante un host que está verdaderamente caído. Un dominio muerto casi nunca responde y da error — simplemente no está ahí.
Esto importa si construyes algo que sigue enlaces o rastrea una lista: los fallos que realmente vas a encontrar se dividen entre «este dominio ha desaparecido» (reintentar nunca ayuda) y «este sitio me está bloqueando» (una solicitud distinta sí entra). Tratarlos igual es la forma más común de inflar las cifras de salud de la web — y la forma más común en que un scraper desperdicia presupuesto reintentando dominios que nunca responderán.
Los muertos famosos
Los porcentajes agregados son abstractos. Así que ordenamos los dominios realmente muertos por rango de popularidad y buscamos nombres que reconocerías — y el cementerio es notable. El dominio muerto con el rango más alto de todo el top 10 millones ilustra el punto por sí solo.
En el puesto #568 está fanlink.to, el servicio de «smart-link» musical que artistas y sellos usaban para enlaces de pre-guardado y streaming. En marzo de 2024, su matriz — ToneDen, de Eventbrite — perdió el control del dominio .to y nunca lo recuperó, rompiendo al instante millones de enlaces alojados en biografías de artistas, anuncios y comunicados de prensa.
Lo que plantea la pregunta obvia: ¿cómo puede un dominio muerto ser el 568.º más popular de la web? Porque la web nunca dejó de llamar a la puerta. Cada enlace, incrustación y marcador no actualizado sigue disparando solicitudes hacia una dirección que ya no responde — el rango es un fósil de la popularidad pasada. Es exactamente por eso que una lista ordenada por popularidad está llena de cadáveres.
Music & video
fanlink.to† 2024Music smart-links · ToneDen / Eventbrite
The single highest-ranked dead domain in the whole top 10M (#568). In March 2024 Eventbrite lost control of the .to domain overnight, instantly breaking millions of artists' pre-save and streaming links sitting in bios, ads, and press releases. Wayback ↗
grooveshark.com† 2015Free music streaming · ~20M users
Forced shut by the major labels' copyright suit (willful infringement, ~$700M of exposure). The entire catalogue was wiped the day the settlement landed; a co-founder died months later at 28. Wayback ↗
rdio.com† 2015Music subscription service
Bankrupt after burning ~$2M a month. Pandora bought the technology for $75M and shut the service down the day before the sale closed. Wayback ↗
gfycat.com† 2023GIF host for Reddit & Discord · ~220M users
Bought by Snap in 2020, then switched off as a non-core asset — one of the largest single link-rot events ever, breaking millions of embedded GIFs across the web. Wayback ↗
veoh.com† 2024Video-sharing site
Won a landmark DMCA case that helped protect every YouTube-style site, limped on for years under Japan's FC2, and finally went dark in November 2024. Wayback ↗
metacafe.com† 2021Top-3 video site of 2006
One of YouTube's first serious rivals — it simply went offline one day in 2021 with no announcement at all. Wayback ↗
The social web
del.icio.us† 2017Delicious · invented social bookmarking
The site that coined web-scale tagging. Passed through five owners (Yahoo → AVOS → Science → Delicious Media → Pinboard for $35,000) before going read-only. Wayback ↗
dmoz.org† 2017The Open Directory · a human-curated map of the web
91,000 volunteers cataloguing 3.8M sites — once a near-prerequisite for SEO, then made obsolete by Google's algorithm. Lives on as the community fork Curlie. Wayback ↗
pipes.yahoo.com† 2015Yahoo Pipes · visual no-code data mashups
The “Zapier of 2007.” Killed in a Yahoo cost-cut; thousands of live RSS and data pipelines broke on the same day. Wayback ↗
topsy.com† 2015The only full historical Twitter search
Indexed hundreds of billions of tweets back to 2006. Apple bought it for ~$200M and quietly switched it off two years later; the searchable archive simply vanished. Wayback ↗
aviary.com† 2018Photo-editing SDK embedded in 7,000+ apps
Powered in-app photo editing across the mobile economy (10B edits). Adobe acquired it, folded the tech into Creative Cloud, then sunset the free SDK. Wayback ↗
The developer web
s7.addthis.com† 2023Share buttons + tracking on 15M websites
Oracle bought it for the behavioural data, then killed it under GDPR pressure — a single shutdown darkened share widgets across millions of sites at once. Wayback ↗
programmableweb.com† 2023The public directory of ~19,000 web APIs
The index of the “API economy” for 17 years. Salesforce / MuleSoft erased the whole thing with no archive. Wayback ↗
securityfocus.com† 2021Home of the Bugtraq disclosure list (since 1993)
The security world's noticeboard for nearly 30 years. Symantec → Broadcom → Accenture let it freeze; the Bugtraq archive survives only at seclists.org. Wayback ↗
opensolaris.org† 2013Sun's open-source operating system
Oracle froze it the moment it bought Sun and pulled the domain in 2013. The community kept the code alive as the illumos fork. Wayback ↗
sorbs.net† 2024Spam blocklist covering 512M IP addresses
A DNS blocklist that mail servers queried for over two decades. Proofpoint pulled the plug in 2024; servers worldwide still query a list that no longer answers. Wayback ↗
Government & institutions
patft.uspto.gov† 2022US patent full-text search (1790–present)
Retired for a new search tool — breaking decades of direct patent links embedded in academic papers, legal briefs, and analysis tools. Wayback ↗
petitions.whitehouse.gov† 2021Obama's “We the People” e-petitions
A petition once topped a million signatures. The platform was quietly discontinued on Inauguration Day 2021 and never revived. Wayback ↗
weblogs.com† ~2009Dave Winer's blog-ping server · the early blogosphere's heartbeat
Every new blog post once pinged this host; VeriSign paid $2.3M for it. It faded after 2009 — yet old WordPress installs still ping the dead address to this day. Wayback ↗
europa.eu.int† 2006The European Union's original web address
The canonical home of EU law and institutions for over a decade. Migrated to europa.eu on Europe Day 2006, stranding a generation of links. Wayback ↗
Lee esos veinte obituarios seguidos y una causa de muerte destaca: ser adquirido. Siete de los veinte fueron comprados por una empresa más grande que luego los apagó — Snap mató a Gfycat, Apple mató a Topsy, Oracle mató tanto a AddThis como a OpenSolaris, Adobe mató a Aviary, Salesforce mató a ProgrammableWeb, Broadcom dejó que SecurityFocus se pudriera. El «acqui-kill» (comprar para matar) supera a la quiebra, las demandas y el abandono juntos.
Veinte protagonistas no pueden mostrar la forma de todo el cementerio. Así que ampliamos el objetivo — extrayendo ~100 cierres ampliamente reconocidos y verificables (de los dominios muertos de este escaneo y del registro público), fechando cada uno en el año en que terminó su servicio y clasificándolos en seis rincones de la web. Apiladas por año, dos décadas de la web moribunda se ven así:
Show the data
| Topic | 2006 | 2007 | 2008 | 2009 | 2010 | 2011 | 2012 | 2013 | 2014 | 2015 | 2016 | 2017 | 2018 | 2019 | 2020 | 2021 | 2022 | 2023 | 2024 | 2025 | 2026 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Redes sociales y comunidad | 0 | 0 | 0 | 1 | 1 | 2 | 4 | 2 | 1 | 2 | 1 | 2 | 4 | 1 | 2 | 1 | 1 | 3 | 1 | 1 | 0 |
| Desarrollo e infraestructura | 0 | 0 | 0 | 1 | 0 | 0 | 3 | 1 | 3 | 2 | 4 | 4 | 2 | 1 | 1 | 2 | 0 | 4 | 1 | 1 | 0 |
| Música y vídeo | 0 | 0 | 0 | 1 | 0 | 0 | 1 | 0 | 0 | 2 | 3 | 2 | 1 | 0 | 3 | 2 | 0 | 2 | 2 | 0 | 0 |
| Búsqueda y referencia | 0 | 0 | 1 | 1 | 0 | 0 | 0 | 2 | 0 | 1 | 0 | 1 | 0 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | 1 |
| Medios y noticias | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 1 | 0 | 0 | 0 | 0 | 1 | 1 | 0 | 1 | 0 | 1 |
| Comercio y gobierno | 1 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | 1 | 0 | 1 | 0 | 1 | 0 | 1 | 1 | 0 | 0 | 0 | 0 |
Dos cosas destacan. Las plataformas sociales y las herramientas para desarrolladores son el grueso de la web muerta — el cementerio social (Friendster, Orkut, Bebo, Google+, Path, Yik Yak, Ello, Digg…) y la columna de herramientas para desarrolladores (Google Code, Parse, Google Wave, Gitorious, Sunrise, Mailbox…) están muertas prácticamente a la par, y juntas son más de la mitad de todo lo que hay aquí. Y las muertes se agrupan: una primera oleada en 2012–2017, cuando colapsó la generación de la Web 2.0 y de las apps de check-in/anónimas, y luego una segunda desde 2020, cuando se recortaron las apuestas de la era pandémica y de las grandes tecnológicas (Quibi, Mixer, CNN+, Stadia, Google Play Music). Antes de 2009 el flujo apenas existe — la mayor parte de la web simplemente no era lo bastante vieja como para haber muerto todavía.
Una advertencia honesta, y la razón por la que revisamos cada dominio a mano: un dominio muerto no siempre es una cosa muerta. Algunos solo parecen muertos porque el servicio cambió de marca o se mudó — money.yandex.ru se convirtió en YooMoney, el antiguo host suicidepreventionlifeline.org dio paso a 988lifeline.org, el europa.eu.int de la UE simplemente pasó a ser europa.eu. Volvimos a sondear cada dominio anterior contra DNS en vivo en junio de 2026 y descartamos los falsos positivos (nrel.gov y angelfire.com siguen resolviendo sin problemas). Lo que queda ya no responde de verdad.
La muerte es desigual: qué TLD se pudren más rápido
La tasa de muerte no está distribuida de forma uniforme. Divide los 10 millones por dominio de nivel superior y aparece un gradiente claro — los TLD de registro barato e institucionales se pudren mucho más rápido que la línea base de .com.
Los casos destacados cuentan dos historias. .cn, .info e .in lideran porque son baratos y se registran masivamente para sitios efímeros o especulativos que caducan rápido. Pero que .gov (26%) y .edu (22%) estén cerca de la cima es el hallazgo más llamativo: los dominios institucionales se pudren mal porque el contenido se reorganiza, los departamentos se disuelven, y los antiguos sitios de proyectos simplemente se apagan — exactamente la decadencia digital que Pew Research documentó en 2024, donde las páginas gubernamentales y de referencia tenían algunos de los peores casos de link rot. Los rincones más autorizados de la web son algunos de los menos permanentes.
La geografía de la web muerta
Agrupa los dominios de código de país por país y la decadencia dibuja un mapa. Los auges de registro en mercados emergentes de la última década dejaron los cementerios más grandes — el .cn de China lidera con un tercio muerto —, mientras que la Europa de habla alemana mantiene la web más duradera del planeta.
Show the data
| China (.cn) | 33% |
| India (.in) | 25.9% |
| Estados Unidos (.us) | 22% |
| Brasil (.br) | 20.9% |
| España (.es) | 16.6% |
| Japón (.jp) | 15.6% |
| Reino Unido (.uk) | 15.3% |
| Rusia (.ru) | 14.9% |
| Francia (.fr) | 14.5% |
| Canadá (.ca) | 14.1% |
| Italia (.it) | 13.5% |
| Polonia (.pl) | 13.2% |
| Suecia (.se) | 11.6% |
| Suiza (.ch) | 9.8% |
| Países Bajos (.nl) | 9.7% |
| Austria (.at) | 8.6% |
| Alemania (.de) | 7.6% |
| Chequia (.cz) | 7.3% |
Un dominio en el espacio .cn de China tiene más de cuatro veces más probabilidades de estar muerto que uno en el .de de Alemania. El registro rápido, barato y especulativo — y, en el caso de .cn, un mercado con mucha rotación detrás del Gran Cortafuegos — deja atrás más dominios abandonados; los TLD de habla alemana, más maduros y más caros de registrar, apenas se pudren.
De qué está hecho en realidad el top 10 millones
Para dar contexto, aquí está la forma del corpus en sí. .com no es solo el primero — es casi la mitad de todo el top 10 millones, más grande que todos los códigos de país y los nuevos gTLD combinados.
Dos detalles que vale la pena señalar: .io (3.6%) se ha convertido calladamente en el tercer TLD más grande de la web popular — la opción por defecto para desarrolladores y startups —, y el .ai de la era de la IA (0.30%, ~30,000 dominios) ya ha superado a dominios de país establecidos como .fi, .no y .tw en el top 10 millones.
La web muerta es la larga cola que nadie visita
La muerte no está distribuida uniformemente en el ranking. Divide los 10 millones por popularidad y la tasa de muerte se dispara más de 20× — del 0.8% en el top 1,000 al 16.1% pasado el rango 5 millones. blocked va en sentido contrario: los sitios con más tráfico bloquean a los bots con más fuerza, y luego las defensas se diluyen a medida que avanzas por la cola.
Ese gradiente replantea el titular. El 14% es real en número de dominios — pero esos dominios muertos están casi todos en la parte de la web que nadie visita. El 99.8% de los dominios muertos están por debajo del rango 100,000, y el top-100K popular — donde vive la abrumadora mayoría del tráfico web — solo está 2.2% muerto. Ponderada por atención en lugar de por conteo bruto, la web muerta casi desaparece:
proporción de los dominios del top 10M que están muertos
el top-100K popular, donde está la mayor parte del tráfico web, solo está 2.2% muerto
«Web muerta» no es «link rot» — y desde luego no es la «teoría del internet muerto»
Tres cosas distintas se mezclan entre sí. Mantenerlas separadas es todo el punto:
- Este estudio (dominios muertos): ¿el dominio sigue resolviendo y respondiendo? Encontramos que el 14.2% del top 10M no lo hace.
- Link rot (Pew, Ahrefs): ¿los enlaces dentro de páginas vivas siguen funcionando? Pew Research encontró que el 25% de las páginas de 2013–2023 han desaparecido y que el 38% de las páginas de 2013 se han esfumado; Ahrefs encontró que el 66.5% de los enlaces rastreados se han podrido. Eso mide la decadencia dentro de la web viva — un complemento a esto, no la misma cifra.
- Teoría del internet muerto: la afirmación de que el contenido generado por IA y los bots han desplazado la actividad humana en línea. Eso trata sobre qué hay en la web viva, no sobre si los dominios son alcanzables. Es una conversación distinta, y confundirla con el link rot es como se propagan las malas estadísticas.
Si solo recuerdas una distinción: el link rot trata sobre las páginas que siguen en pie; la web muerta trata sobre los dominios que no lo están.
Qué significa esto si estás construyendo un scraper o un pipeline de datos
La conclusión práctica es la porción del 8.9% bloqueada, porque es la parte con más probabilidades de romper tu proyecto. Cuando una solicitud falla, el motivo determina la solución, y no se parecen en nada:
- Un dominio muerto (sin DNS, rechazado) nunca responderá. Reintentar, rotar proxies o cambiar a un navegador no sirve de nada. Descártalo y sigue adelante.
- Un dominio bloqueado está vivo y es alcanzable — simplemente rechazó a tu cliente. Una huella TLS/JA3 de navegador coincidente o una IP residencial entran donde un bot de centro de datos recibe un 403. Es un problema de transporte, no un sitio muerto.
Esto no es teórico. Sondear cada dominio una segunda vez con una huella TLS/JA3 de Chrome real recuperó ~72,000 de los ~890,000 sitios de los que el bot educado estaba bloqueado — suficiente para bajar la tasa de bloqueo del 8.9% al 8.2%. Cada uno de esos es un sitio vivo, alcanzable con el cliente adecuado, no un callejón sin salida.
Los rastreadores ingenuos no pueden distinguir entre ambos, así que o bien se rinden con sitios alcanzables o queman presupuesto reintentando los que ya desaparecieron. El patrón eficiente en costes es escalar solo hasta donde un sitio te obligue — que es exactamente cómo funciona el anti-bot unblocker de Crawlora, y por qué cobra por éxito en lugar de por intento. Si quieres saber en qué categoría cae una URL concreta antes de construir nada, el verificador anti-bot gratuito te lo dice en unos 30 segundos, y nuestro Anti-Bot Adoption Index complementario mide cuánta de la web viva levanta un muro.
Dos cosas más que reveló el escaneo
La web es un laberinto de redirecciones. Solo el 69% de los dominios sirve su página final directamente; el 31% rebota a través de al menos una redirección — y una porción obstinada da vueltas hasta nuestro límite de 10 saltos. Por eso exactamente un rastreador que no sigue redirecciones ve una web que parece medio rota.
La web muerta se quedó atascada en HTTP. Una década después de la transición a HTTPS, la web viva está ~78% encriptada — pero los dominios muertos y bloqueados por bots apenas llegan a la mitad, abandonados antes de que llegaran a obtener un certificado.
Cómo lo medimos
Sin magia — un sondeo deliberadamente simple y reproducible, ejecutado a escala de 10 millones.
La lista. Los 10 millones de dominios principales completos (un ranking de popularidad al estilo DomCop/Tranco). Alcanzamos 9,992,781 de ellos — 99.95% de cobertura.
El sondeo. Cada dominio se obtiene primero por HTTPS desde una IP de centro de datos, siguiendo redirecciones, con un tiempo de espera corto y un reintento de DNS entre varios resolutores antes de cualquier veredicto de «DNS fallido». Nunca enviamos un formulario, resolvemos un CAPTCHA, iniciamos sesión, ni obtenemos nada detrás de un muro. Cada dominio se sondea dos veces — una como bot honesto, y otra como cliente parecido a un navegador con una huella TLS/JA3 de Chrome real — para poder separar «no hay nadie en casa» de «al bot no lo dejaron entrar».
La clasificación. Un 2xx final, o un 404/5xx servido (el host respondió), es alive. Un 403/429 o un desafío anti-bot es blocked. Un 3xx que no podemos resolver es redirect. Solo la ausencia de DNS, una conexión rechazada/reiniciada, o nada que acepte una conexión, es dead. Esa única regla — un servidor que responde cualquier cosa está activo — es toda la diferencia entre 14.2% y 27.6%.
Límites. Esto es alcanzabilidad a nivel de página de inicio desde un punto de vista de centro de datos, así que es un límite inferior: un dominio que bloquea a un bot de centro de datos puede abrirse para un navegador residencial, y una página profunda puede estar más muerta (o más defendida) que la página de inicio. Instantánea: junio de 2026. El conjunto de datos completo por dominio — cada dominio, cada rama — es abierto, y la versión en vivo y consultable es el Dead-Web Index.
Llega a la web viva, no a la muerta
El 14% de la web principal ha desaparecido — pero el 9% está vivo y solo bloquea a tu bot. Crawlora escala desde una solicitud simple hasta una huella de navegador real solo hasta donde un sitio lo exige, y cobra por éxito. Deja de reintentar dominios muertos y de recibir 403 de los que están vivos.
Preguntas frecuentes
¿Cuántos de los principales sitios web del mundo están muertos?
El 14.2% de los 10 millones de dominios principales está realmente muerto — unos 1.41 millones de sitios que ya no resuelven en DNS o rechazan cada conexión. Eso está muy por debajo del 27.6% que se cita a menudo, que contaba los bloqueos anti-bot y los errores respondidos como muerte.
¿Cuál es la diferencia entre un sitio web muerto y uno bloqueado?
Un sitio muerto nunca responde — sin registro DNS, o nada acepta una conexión TCP. Un sitio bloqueado está vivo y respondiendo, simplemente rechaza a un cliente automatizado (un 403, 429, o un desafío anti-bot). El 8.9% de la web principal — 891,672 sitios — está bloqueado, no muerto, una distinción que los rastreadores ingenuos pasan por alto.
¿La web muerta es lo mismo que la teoría del internet muerto?
No. La teoría del internet muerto es la afirmación de que el contenido generado por IA y los bots han reemplazado la actividad humana en la web viva. Este estudio mide lo contrario, algo concreto: cuántos dominios se han apagado por completo y son inalcanzables — DNS desaparecido, conexión rechazada, servidor desaparecido.
¿Por qué esto es más bajo que la cifra del 27.6% de la web muerta?
Los rastreos anteriores del top 10M contaban tres cosas que no estaban muertas como si lo estuvieran: bloqueos anti-bot 403/429, páginas 404/5xx servidas por un servidor vivo, y dominios que un único resolutor DNS inestable no logró consultar. Clasificar con honestidad — muerto significa realmente inalcanzable — lleva la cifra real al 14.2%.
¿Qué TLD tiene más dominios muertos?
.cn tiene la tasa de muerte más alta entre los TLD comunes, con un 33%. Los TLD institucionales como .gov (26%) y .edu (22%) también se ubican en lo alto — coincidiendo con el hallazgo de Pew Research de que las páginas gubernamentales y de referencia sufren el peor link rot.
¿Por qué un sitio parece muerto para un scraper pero carga bien en mi navegador?
Los sistemas anti-bot sirven un 403 o un desafío a una IP de centro de datos mientras dejan pasar a un navegador real. Una huella TLS/JA3 de navegador coincidente llega al sitio donde un bot ingenuo es bloqueado — por eso este estudio sondea cada dominio dos veces, como bot educado y como cliente parecido a un navegador.