Tony Wang11 min de lecturaSeguimos 173 millones de dominios durante 8 años. ~40 M murieron.
Rastreamos 172,9 M de dominios en 80 archivos de Common Crawl (2018–2026). Unos 40 M murieron; el crawl sobrestima la muerte en un tercio.
Hay una forma limpia y satisfactoria de medir la web muerta, y es incorrecta. Toma una gran lista de dominios de hace unos años, comprueba cuáles siguen apareciendo hoy, y declara muertos a los que faltan. Common Crawl lo pone casi demasiado fácil: lleva años publicando una instantánea mensual de la web, así que puedes alinear los archivos y observar cómo los dominios van desapareciendo.
Eso es exactamente lo que hicimos — 80 archivos mensuales de Common Crawl, de enero de 2018 a mayo de 2026, con 172.959.928 dominios registrados — y luego hicimos la parte que todos se saltan. Tomamos los dominios que habían desaparecido y les preguntamos, en vivo, si de verdad se habían ido. Un tercio respondió. La cifra honesta de la web muerta es de unos 40 millones de dominios, ~23% del conjunto de ocho años — pero solo porque nos negamos a contar un dominio como muerto solo porque Common Crawl dejó de verlo.
Ocho años de la web, ordenados en cuatro destinos
Cada dominio del panel recibe una única etiqueta a partir de su historial completo a través de los 80 crawls. alive_present significa que seguía ahí en el crawl más reciente. dead_candidate significa que estuvo establecido un tiempo, luego se apagó desde un estado sano y nunca volvió. dark_ambiguous significa que también se apagó, pero lo último que vimos fue un bloqueo o un error de servidor — una salida más turbia. intermittent significa que solo apareció de forma esporádica, así que su ausencia no prueba nada.
Dos porciones necesitan cuidado antes de que alguien busque un titular. El 38% intermitente es el descargo honesto: Common Crawl es una muestra, no un censo, y su frontera cambia cada mes, así que un dominio que aparece en tres crawls dispersos y luego nunca más no necesariamente ha muerto — puede simplemente haber caído fuera de la muestra. No contamos esos como muertes. Eso deja el 36% que genuinamente desapareció tras una racha real de presencia (los segmentos dead_candidate y dark_ambiguous juntos, 62,9 millones de dominios) — y hasta esos, resulta, no están todos muertos.
Desaparecer no es morir
Aquí está la trampa, en un solo gráfico. Si te detienes en los archivos de Common Crawl y declaras muerto a todo dominio desaparecido, obtienes 36%. Si tomas una muestra estratificada de 20.000 de esos dominios desaparecidos y reprobas cada uno en vivo — una búsqueda DNS fresca, una conexión TCP, una petición HTTP, en junio de 2026 — solo el 64,2% de ellos son realmente inalcanzables. Proyecta eso hacia atrás y la cifra real de la web muerta es de alrededor del 23%.
62,9 M de dominios que salieron del crawl tras una racha establecida de presencia
≈40 M de dominios sin DNS o donde nada acepta una conexión en 2026
La brecha no es ruido; es toda la metodología. Un dominio sale de un crawl por muchas razones que no tienen nada que ver con la muerte: el presupuesto del rastreador se movió a otro lado, el sitio empezó a bloquear robots, una cadena de redirecciones confundió al fetcher, o el dominio simplemente no fue muestreado ese mes. Una desaparición es una hipótesis, no un hallazgo. La calibración — volver atrás y comprobar una muestra representativa contra el internet vivo — es lo que convierte "desaparecieron 62,9 millones de dominios" en un defendible "unos 40 millones están realmente muertos".
Entonces, ¿qué resultaron ser los dominios desaparecidos cuando llamamos a la puerta en 2026?
Casi un tercio de los dominios que cayeron fuera de Common Crawl están aún vivos — resuelven y sirven una página ahora mismo. Dejaron el crawl, no la web. Ese único hecho es la razón por la que las cifras de titular sobre la web muerta basadas solo en desapariciones salen infladas, y por la que la nuestra es deliberada y defendiblemente más baja.
Muerto y bloqueado son fallos distintos
Lo otro que te da una reprueba en vivo es la distinción que los crawls ingenuos borran: muerto (nadie en casa) frente a bloqueado (en casa, pero no le abre la puerta a un bot). Ambos se ven como "no se pudo obtener" para un scraper, y exigen respuestas opuestas — un dominio muerto nunca responderá hagas lo que hagas, mientras que uno bloqueado se abre para el cliente correcto. La probabilidad de que un dominio desaparecido esté realmente muerto depende en gran medida de la última señal sana que vimos antes de que se apagara.
Lee la barra inferior con cuidado, porque es el hallazgo contraintuitivo: un dominio visto por última vez bloqueando bots apenas es más probable que estar muerto que un lanzamiento de moneda. Casi la mitad de esos dominios "desaparecidos mientras bloqueaban" están vivos y coleando — simplemente le cerraron la puerta al rastreador y luego cayeron de la muestra. Un dominio visto por última vez sano, en cambio, tiene más del 70% de probabilidad de haber muerto genuinamente: un sitio sano se queda callado porque lo apagaron, no porque empezó a rechazar robots. Si tratas igual cada intento fallido de obtención, das por muertos a un montón de sitios vivos y defendidos.
Esto no es "teoría del internet muerto" — ni link rot
Cada vez que sale a relucir la decadencia de la web se mezclan tres preguntas distintas. Separarlas es el punto:
- Este estudio (dominios muertos): ¿sigue el dominio resolviendo y respondiendo? En un panel de 8 años y 173 millones de dominios, alrededor del 23% ya no lo hace.
- Link rot (Pew, Ahrefs): ¿están bien los enlaces dentro de páginas aún vivas? Pew Research encontró que el 38% de las páginas de 2013 habían desaparecido para 2023; Ahrefs encontró que dos tercios de los enlaces rastreados se pudren. Eso mide la decadencia dentro de la web viva — un complemento a esto, no la misma cifra.
- Teoría del internet muerto: la afirmación de que bots y contenido generado por IA han desplazado a los humanos en la web viva. Eso trata de qué hay en las páginas que todavía cargan — una conversación completamente separada.
Si te quedas con una sola línea: el link rot trata de las páginas que siguen en pie; la web muerta trata de los dominios que ya no están; la teoría del internet muerto trata de quién escribe las páginas que sí están. Este estudio es estrictamente la del medio.
Cómo lo medimos
El método es deliberadamente simple y totalmente reproducible — y la herramienta open source que lo ejecuta es la misma que hay detrás de esta publicación.
El corpus. Common Crawl publica un índice columnar para cada crawl mensual, incluido un subconjunto robotstxt — una fila por host al que le obtuvo un robots.txt. Leímos ese subconjunto para los 80 crawls desde CC-MAIN-2018-05 hasta CC-MAIN-2026-21, agregamos cada uno al dominio registrado, y registramos, por crawl, si el dominio estaba presente y qué estado HTTP devolvió. La unión son 172.959.928 dominios.
Por qué desaparición, no estado. El fetch_status que registra Common Crawl es exclusivamente HTTP — un dominio que está genuinamente muerto no produce ninguna fila, no una fila con un error. Así que la muerte no se puede leer de un código de estado; hay que inferirla de que un dominio desaparezca a través de crawls consecutivos. Esa inferencia es exactamente lo que hace obligatoria la calibración.
Las etiquetas. Para cada dominio calculamos su primer y último crawl, en cuántos de los 80 apareció, su racha más larga de ausencia reciente, y el último estado que vimos. Un dominio que estuvo presente durante varios crawls y luego ausente de los más recientes — desde un estado sano — es un dead_candidate; desde un estado bloqueado o con errores, dark_ambiguous; los dominios vistos de forma esporádica son intermittent y nunca se cuentan como muertes.
La calibración. Extrajimos una muestra estratificada de 20.000 de los dominios desaparecidos y reprobamos cada uno en vivo en junio de 2026 — resolución DNS, una conexión TCP y una petición HTTP — clasificándolo como muerto, vivo o bloqueado. Las tasas de muerte por estrato (con intervalos de confianza Wilson del 95%) convierten los recuentos crudos de "así de muchos desaparecieron" en el calibrado "así de muchos están realmente muertos". Ese paso es la diferencia entre 36% y 23%.
Límites, con honestidad. Common Crawl es una muestra de la web, no un censo, y su cobertura va cambiando a lo largo de ocho años — precisamente por eso calibramos en lugar de confiar en la desaparición, pero también significa que el panel está sesgado hacia los dominios que Common Crawl eligió rastrear, y un dominio al que nunca le obtuvo un robots.txt nunca entra en el conjunto. La reprueba en vivo es un único punto de vista de un centro de datos a mediados de 2026, así que un dominio que bloquea IPs de centros de datos puede leerse como bloqueado cuando un navegador residencial sí entraría, y un dominio aparcado que sirve un 200 se lee como vivo. La proyección de la tasa de muerte asume que las tasas por estrato de la muestra de 20k se mantienen en todo el estrato completo. Instantánea: el panel termina en mayo de 2026; la reprueba se ejecutó en junio de 2026.
El panel completo por dominio — las 172,9 millones de filas, cada etiqueta y campo — está abierto bajo CC BY 4.0, y la CLI que lo construyó es open source. Si quieres la vista en vivo e interactiva de la web de hoy en lugar del historial de 8 años, el Dead-Web Index que lo acompaña y el estudio instantáneo El 14% de la web está realmente muerto miden lo mismo en la web mejor posicionada actual.
Distingue un dominio muerto de uno bloqueado — automáticamente
Un tercio de la web 'muerta' no está muerta; está viva y rechazando bots. Crawlora escala desde una petición simple hasta una huella de navegador real solo hasta donde un sitio lo exige, y cobra por éxito — así dejas de reintentar dominios que ya no existen y dejas de recibir 403 de dominios vivos.
Preguntas frecuentes
¿Cuánto de la web ha muerto desde 2018?
Alrededor del 23%. Construimos un panel de accesibilidad de 8 años con 172.959.928 dominios a partir de 80 archivos mensuales de Common Crawl (2018–2026); unos 40 millones están calibrados como genuinamente muertos — sin DNS, o nada acepta una conexión. Esa cifra es bastante menor que el 36% que se obtiene al contar todo dominio que simplemente dejó de aparecer en el crawl, porque desaparecer de una muestra de la web no es lo mismo que dejar la web.
¿Significa desaparecer de Common Crawl que un dominio está muerto?
No. Common Crawl es una muestra móvil de la web, no un registro, así que un dominio puede caer fuera porque el presupuesto del rastreador se movió a otro lado, empezó a bloquear robots, o simplemente no entró en la muestra ese mes — no porque muriera. Cuando reprobamos en vivo en 2026 una muestra estratificada de 20.000 dominios desaparecidos, solo el 64,2% estaban realmente muertos; el 31% aún resolvía y respondía, y el 4,7% estaba vivo pero bloqueando bots.
¿Cuál es la diferencia entre un dominio muerto y uno bloqueado?
Un dominio muerto nunca responde — no hay registro DNS, o nada acepta una conexión TCP. Un dominio bloqueado está vivo y responde; solo rechaza a un cliente automatizado con un 403, un 429 o un desafío anti-bot. Exigen respuestas opuestas (un dominio muerto nunca responderá, haga lo que haga; uno bloqueado se abre para el cliente correcto), y un dominio visto por última vez bloqueando bots solo tiene un 44,7% de probabilidad de estar muerto, frente al 70,7% de uno visto por última vez sano.
¿Es esto lo mismo que la teoría del internet muerto?
No. La teoría del internet muerto es la afirmación de que bots y contenido generado por IA han desplazado a los humanos en la web viva — una pregunta sobre qué hay en las páginas que todavía cargan. Este estudio mide algo concreto y distinto: si el dominio en sí sigue resolviendo y respondiendo. También es diferente del link rot, que mide enlaces rotos dentro de páginas aún vivas.
¿Cómo se construyó el conjunto de datos Dead-Web Common Crawl?
A partir del subconjunto mensual robotstxt del índice de Common Crawl en 80 crawls (de CC-MAIN-2018-05 a CC-MAIN-2026-21), agregado a una fila por dominio registrado con su historial de presencia y estado HTTP. Como el estado de Common Crawl es exclusivamente HTTP, un host muerto no produce ninguna fila, así que la muerte se infiere de la desaparición y luego se calibra contra una reprueba en vivo. El panel completo de 172,9 millones de filas está abierto bajo CC BY 4.0, y la CLI crawlora-deadweb que lo construyó es open source.