Tony Wang8 min de lecturaAñadimos 324,523 cuentas de X encontradas en la web abierta. La tasa de check azul cayó del 19% al 5%.
Un nuevo canal —menciones web, no listas curadas— sumó 324,523 perfiles de X. Verifican 1/4 de veces y tienen 1/6 de mega-cuentas.
Hace cuatro estudios, describimos nuestro índice de usuarios de X como 325,553 perfiles públicos obtenidos a partir de Wikidata, GitHub, fundadores de startups y periodistas. Esa cifra ya estaba desactualizada para cuando se publicó el tercer estudio — el rastreo orgánico ya había llevado a los niveles curados a 471,437. Después, en el transcurso de cuatro días a fines de julio, el índice volvió a dar un salto: hasta 796,611. No porque agregáramos una quinta lista de siembra curada, sino porque activamos Common Crawl como canal de descubrimiento: encontrar cuentas de X de la misma manera en que un motor de búsqueda encuentra páginas web, leyendo lo que la web abierta ya enlaza y menciona, en lugar de partir de una lista de notoriedad.
Ese único canal agregó 324,523 cuentas casi de la noche a la mañana. Ahora es el segundo nivel más grande del índice, justo detrás de Wikidata y justo por delante de todas las demás fuentes combinadas. Lo que plantea la pregunta obvia: ¿una cuenta de X descubierta al leer la web abierta se parece a una cuenta de X descubierta al verificar quién tiene una entrada en Wikidata? No es así.
La nueva mitad no se parece en nada a la anterior
Dividamos el índice en dos — los 324,523 perfiles de Common Crawl frente a los 472,088 perfiles del resto de los niveles (Wikidata, GitHub, búsqueda de X, el grafo de seguidores, fundadores, periodistas y el resto) — y comparemos las mismas señales sobre las que se construye el resto de este conjunto de datos:
| Señal | Common Crawl (n=324,523) | Todos los demás niveles (n=472,088) |
|---|---|---|
| Check azul | 4.9% | 18.9% |
| Tiene biografía | 81.4% | 91.8% |
| Tiene enlace externo | 63.6% | 76.7% |
| Sigue a más de los que le siguen (ratio < 1) | 48.2% | 20.7% |
| 100K+ seguidores | 1.6% | 9.8% |
| Cero seguidores | 4.2% | 1.2% |
Todas esas brechas apuntan en la misma dirección: Common Crawl encontró un segmento más ordinario de X. Menos de sus cuentas pagan por la verificación, menos se molestaron en llenar una biografía, y casi la mitad sigue a más personas de las que las siguen a ellas — la forma típica de «sigue a desconocidos» de una cuenta social cotidiana, no la forma «recibe seguidores» de una cuenta notable. Solo el 1.6% supera los 100,000 seguidores, una sexta parte de la tasa en los niveles curados.
Una cifra rompe el patrón, y vale la pena detenerse en ella: el 63.6% de las cuentas de Common Crawl aún tiene un enlace externo, solo 13 puntos por debajo de los niveles curados. Eso no es una coincidencia del método de descubrimiento — es el mecanismo mismo. Common Crawl encuentra una cuenta de X porque alguna página web archivada enlaza a ella, y una proporción desmedida de esas páginas es el propio sitio web de la cuenta, acreditándose a sí misma. El canal está estructuralmente sesgado hacia cuentas con un enlace, aunque no esté sesgado hacia cuentas con una gran cantidad de seguidores.
La cuenta más grande de Common Crawl por número de seguidores es @NetflixBrasil, la cuenta de marca brasileña de Netflix, con 37.5 millones de seguidores — prueba de que el nivel no está compuesto solo por cuentas pequeñas, sino de que las cuentas pequeñas lo dominan numéricamente.
Misma forma, más pronunciada en la parte baja
El resto de este conjunto de datos muestra que la verificación aumenta de manera constante con el número de seguidores — una señal de suscripción paga, no un marcador de identidad, que escala con el alcance. Ese gradiente también se mantiene dentro de Common Crawl, pero parte de un piso mucho más bajo:
| Banda de seguidores | Participación verificada en Common Crawl | Participación verificada en otros niveles |
|---|---|---|
| Menos de 100 seguidores | 0.29% | 4.5% |
| 100,000+ seguidores | 53.3% | 57.8% |
En la parte alta, las dos poblaciones convergen — más de la mitad de las cuentas con 100K+ seguidores de ambos grupos están verificadas, porque la política de X de 2023 de otorgar checks gratuitos a cuentas grandes no distingue de qué nivel de siembra provino el perfil. En la parte baja, divergen marcadamente: una cuenta con menos de 100 seguidores tiene más de quince veces más probabilidades de estar verificada si proviene de un nivel curado (donde «curado» ya implica cierto grado de notoriedad o presencia profesional) que si surgió de una mención web aleatoria. El gradiente tiene la misma forma; Common Crawl simplemente parte de mucho más abajo en la cuesta.
No son cuentas nuevas — la web abierta simplemente no había enlazado a ellas todavía
La hipótesis obvia para un canal que encuentra cuentas a través de menciones web es que capta sobre todo actividad reciente — sitios nuevos, enlaces nuevos, cuentas nuevas. No es así:
Casi cuatro de cada cinco cuentas de Common Crawl son anteriores a 2015. Son cuentas viejas en páginas web viejas — un blog comunitario de hace una década, el pie de página «síguenos» de una empresa, la firma de un foro — que un rastreo estilo motor de búsqueda del archivo de la web termina sacando a la luz, y que una lista de siembra basada en notoriedad (Wikidata, GitHub, una base de datos de fundadores) nunca tuvo motivo para captar. El nivel no está encontrando usuarios nuevos. Está encontrando usuarios viejos y ordinarios que el resto del índice nunca estuvo diseñado para atrapar.
Qué demuestra esto, y qué no
Lo que consideramos que se sostiene: agregar un canal de descubrimiento que encuentra cuentas a través de menciones en la web abierta, en lugar de siembra por notoriedad, cambia materialmente la composición de un índice de perfiles de X — menor verificación, biografías más escasas, menos mega-cuentas, un comportamiento de seguimiento más cotidiano — sin cambiar la antigüedad de esas cuentas. El gradiente de alcance-verificación que este conjunto de datos ya había documentado se replica dentro de la nueva población, solo que desde un piso más bajo.
Qué lo limita:
- Common Crawl tiene su propio sesgo de selección, no ausencia de sesgo. Saca a la luz cuentas a las que alguna página web archivada enlazó o mencionó — lo cual favorece a cuentas con sitio web, una mención de prensa o presencia comunitaria en línea, y desfavorece a cuentas que solo existieron dentro de X. Es una muestra distinta de «con presencia establecida en otro lugar de la web», no un sorteo aleatorio de la base de usuarios de X.
- Se trata de dos instantáneas separadas por cuatro días, no de un experimento controlado — parte del crecimiento de «todos los demás niveles» en la misma ventana provino del recrawleo ordinario de las siembras existentes, no solo de la adición de Common Crawl, aunque eso representa menos del 0.2% de la diferencia.
- La cifra de 325,553 en nuestros cuatro estudios anteriores sobre X ya era un subconjunto desactualizado antes de esto, y ahora describe el 41% del índice actual. Sus porcentajes específicos (tasas de check azul, topes del límite de seguidos, patrones de biografía) se midieron correctamente contra la población de la que provenían; no son automáticamente la verdad del índice completo tal como está hoy.
- Solo publicamos agregados — conteos y porcentajes por cohorte, no registros de perfiles individuales, más allá de la única cuenta pública nombrada arriba.
Nada de esto hace que los estudios anteriores estén equivocados — los hace desactualizados de una forma específica y verificable: describen el segmento curado, y ese segmento curado apenas se ha movido (sus propias proporciones internas concuerdan casi exactamente con la instantánea previa a Common Crawl). Lo que cambió es que el índice ahora también incluye las cuentas que nadie había pensado en sembrar, y en cada señal que importa, responden de manera distinta.
Fuentes
Metodología
Consultamos el conjunto de datos de usuarios de X en vivo, delimitando cada métrica a source_tier=common-crawl y comparándola con la misma métrica en todo el índice (facetas de check azul, biografía y enlace externo; bandas de seguidores; la proporción entre seguidos y seguidores; totales acumulados por año de creación). Las cifras de «todos los demás niveles» en esta pieza son el total del índice completo menos el total delimitado a Common Crawl para cada métrica, no una consulta separada — una resta que concuerda exactamente, ya que cada faceta booleana y cada banda de seguidores suma el total del índice completo. Como verificación de consistencia, las cifras derivadas de «todos los demás niveles» para cuentas con cero seguidores, verificación con menos de 100 seguidores y verificación con 100K+ coinciden casi exactamente con nuestra instantánea previa a Common Crawl (registrada el 2026-07-21), lo que confirma que la población curada en sí apenas se movió en la ventana de cuatro días en que se agregó Common Crawl.
Las cohortes por año de creación usan la misma diferenciación acumulativa created_before=YYYY-01-01 que nuestros otros estudios sobre X, ya que una consulta directa de rango combinado resulta inconsistente en este índice en vivo. Todas las cifras están vigentes a partir del rastreo del 2026-07-25; el índice completo ahora asciende a 796,611 perfiles, reflejado en la página del conjunto de datos de usuarios de X.
¿Quieres hacer tu propio corte? El conjunto de datos de usuarios de X se puede consultar directamente por source_tier, la guía cómo hacer scraping de Twitter/X cubre las llamadas, y precios tiene el nivel gratuito. Consulta también los cuatro estudios que este actualiza: el usuario más prolífico de X es una máquina, el límite real de seguidos de X es 7,500, un desarrollador cualquiera tiene 5 veces más probabilidades que una persona notable de tener un check azul, y lo que revelan las biografías de X. Para ver qué le hizo este cambio de composición a la desigualdad de seguidores en X — la empeoró, no la mejoró — consulta la economía de la atención de X es más desigual que la riqueza de cualquier país. Y para la única señal de completitud en la que las cuentas de Common Crawl realmente superan a las curadas, consulta dónde dicen vivir las cuentas de X.
Preguntas frecuentes
Why did the X users dataset suddenly grow so much?
Our X users index grew from 471,437 to 796,611 profiles in four days in late July 2026 — not from crawling more Wikidata entries, GitHub developers or founders, but from turning on Common Crawl as a new discovery channel. Common Crawl finds X accounts through mentions and links on the open web rather than a notability seed list, and it added 324,523 profiles almost overnight, making it 40.8% of the index.
Are accounts found through Common Crawl different from the rest of the dataset?
Substantially. Common Crawl-discovered profiles carry X's blue check at 4.9% versus 18.9% for every other tier combined — a quarter as often — have a bio 81.4% of the time versus 91.8%, and clear 100,000 followers at a sixth the rate (1.6% versus 9.8%). Nearly half (48.2%) follow more people than follow them back, versus 20.7% for the curated tiers — the shape of an everyday account rather than a notable one.
Are Common Crawl-discovered X accounts newer than the rest of the dataset?
No. 78.0% of Common Crawl accounts were created before 2015, close to the vintage skew of the rest of the index. They are old, ordinary accounts that a notability-first seed list (Wikidata, GitHub, a founder database) had no reason to ever pick up — the open web simply hadn't been read for mentions of them until now.
Does verification still track follower count inside the new Common Crawl tier?
Yes, the same reach gradient holds, just from a lower floor. Only 0.29% of sub-100-follower Common Crawl accounts are verified, versus 4.5% for the equivalent accounts in every other tier; at 100,000+ followers the two groups converge (53.3% versus 57.8%), because X's policy of granting free checks to large accounts doesn't depend on which seed tier found the profile.
Do the numbers in Crawlora's other X studies still apply?
Our four earlier X studies describe a 325,553-profile census, which was already a stale subset of the curated tiers (471,437) before Common Crawl was added, and now covers about 41% of the current 796,611-profile index. Their percentages were measured correctly against the population they drew from and reconcile almost exactly against a fresh re-check of that same curated slice — they just no longer describe the dataset as a whole, which now includes a very different population Common Crawl surfaced.