Tony Wang9 min de lecturaLas cuentas comunes de X indican su ubicación más que las notables
Una auditoría de 2.462 cuentas de X halló que 63% indica ubicación — Common Crawl (65%) supera a las curadas y notables de Wikidata (51%).
Tres estudios de esta serie encontraron el mismo patrón: cuanto más alcance tiene una cuenta de X, más completo es su perfil. Las cuentas verificadas completan la bio más que las no verificadas. Las cuentas curadas y notables completan la bio más que las cuentas que nuestro canal más nuevo, Common Crawl, descubrió mediante menciones web comunes. Fuimos a comprobar si ese patrón se mantenía para un campo más — la ubicación — y esperábamos una cuarta confirmación. En cambio, encontramos el único lugar donde se invierte.
La ubicación no está en los datos masivos — tuvimos que preguntar cuenta por cuenta
Cada otra estadística de esta serie provino de nuestra API de búsqueda pública, que devuelve facetas masivas y conteos filtrados al instante, sin necesidad de obtener registros individuales. La ubicación no es uno de esos campos — los registros de búsqueda masiva y de ítems incluyen nombre de usuario, bio, conteo de seguidores, verificación y nivel de origen, pero no ubicación. Solo aparece en la respuesta de una búsqueda de perfil en vivo, cuenta por cuenta.
Por eso este estudio se construyó de forma distinta a sus predecesores: una muestra estratificada de 2.482 nombres de usuario, extraída de los ocho niveles de descubrimiento principales y seis franjas de seguidores (para evitar sobremuestrear mega-cuentas), consultada individualmente. 2.462 se resolvieron (99,2% — 16 eran privadas o suspendidas, 4 dieron timeout). La ubicación estaba vacía en 901 de ellas y completada en 1.561 — una tasa de completitud del 63,4% en general.
La única señal donde lo "ordinario" supera a lo "notable"
| Nivel de descubrimiento | Tamaño de muestra | Tasa de completitud de ubicación |
|---|---|---|
| Usuarios de GitHub | 583 | 76.8% |
| Búsqueda en X (autenticada) | 202 | 70.3% |
| Periodistas | 148 | 66.9% |
| Common Crawl | 599 | 64.8% |
| Startups de TrustMRR | 92 | 63.0% |
| Creadores de TikTok | 100 | 52.0% |
| Wikidata (curadas/notables) | 596 | 51.2% |
| Grafo de seguidos en X | 142 | 48.6% |
Nuestro estudio sobre Common Crawl encontró que las cuentas de ese nivel completan la bio 13 puntos menos que las curadas (81,4% frente a 91,8%) y llevan el check azul de X una cuarta parte de las veces. En cada señal que midió ese estudio, Common Crawl parecía menos completo, menos notable, más ordinario. La ubicación rompe la racha: las cuentas de Common Crawl (64,8%) la indican con más frecuencia que las curadas y notables de Wikidata (51,2%) — una brecha de 13,6 puntos en la dirección opuesta a la de la bio.
La razón probable no es que las cuentas de Common Crawl sean más diligentes. Es lo que cada nivel realmente representa. Wikidata alimenta este índice con personas lo suficientemente notables como para tener una entrada de enciclopedia — políticos, ejecutivos, atletas — muchas de las cuales gestionan su cuenta a través de un equipo de comunicación o un asistente, o simplemente nunca tocaron los campos de configuración del perfil más allá de un nombre y una bio escrita para el consumo público. Una ubicación implica un riesgo de doxxing que una figura pública no tiene motivos para aceptar. Common Crawl, en cambio, descubre cuentas porque alguna página web ordinaria — un sitio personal, un perfil de foro, un pie de página de "síguenos" — ya enlaza a ellas; el mismo hábito cotidiano de ponerse en el mapa que hace que un rastreo que sigue enlaces te descubra también inclina a escribir una ciudad en un campo de perfil. Los usuarios de GitHub, como era de esperar, encabezan todos los niveles (76,8%) — una línea de ubicación es una parte normal de un perfil de desarrollador profesional, el mismo instinto que hace que un currículum incluya una ciudad.
El gradiente familiar se mantiene — solo que más débil
El alcance sigue prediciendo la completitud del perfil, tal como ocurrió con la bio y la verificación en estudios anteriores — la inversión de niveles de arriba tiene que ver con qué tipo de cuenta completa la ubicación, no con si más seguidores se correlaciona con completar más campos en general:
| Franja de seguidores | Tamaño de muestra | Tasa de completitud de ubicación |
|---|---|---|
| Menos de 100 | 706 | 55.0% |
| 100–999 | 420 | 67.9% |
| 1.000–9.999 | 419 | 69.2% |
| 10.000–99.999 | 413 | 73.6% |
| 100.000+ | 391 | 69.3% |
| Estado de verificación | Tamaño de muestra | Tasa de completitud de ubicación |
|---|---|---|
| Verificada (check azul) | 531 | 73.1% |
| No verificada | 1.931 | 60.7% |
La tasa de completitud sube 18,6 puntos desde las cuentas más pequeñas hasta el rango de decenas de miles bajo, y luego se estabiliza — la misma forma de "rendimientos decrecientes pero reales" que encontraron el estudio del límite de seguidos y el estudio de las bios para otros campos del perfil. Las cuentas verificadas se ubican 12,4 puntos por encima de las no verificadas, en línea con el papel habitual de la verificación en esta serie como un indicador aproximado de qué tan en serio una cuenta trata su perfil público.
Dónde dicen estar las cuentas
Restringiéndonos a las 849 ubicaciones (54,4% de todas las entradas completadas) que pudimos hacer coincidir con confianza a un único país mediante palabras clave — el resto son menciones de solo ciudad sin un marcador claro de país, respuestas regionales o continentales ("Europe", "Africa"), o directamente no son un lugar (ver más abajo):
| País | Proporción de ubicaciones clasificadas |
|---|---|
| Estados Unidos | 23.2% |
| Japón | 6.8% |
| Reino Unido | 5.7% |
| Brasil | 2.4% |
| India | 2.4% |
| Alemania | 2.2% |
| Francia | 2.0% |
| Canadá | 1.7% |
| España | 1.1% |
| Australia | 1.1% |
Las cadenas de texto individuales más comunes, sin clasificar por país, fueron exactamente las ciudades que cabría esperar de un corpus en inglés e inclinado hacia lo tecnológico y mediático: San Francisco (17 menciones), Los Ángeles (14), Washington DC (13), Londres (12), Nueva York (12) — junto con 13 perfiles que escribieron 日本 (Japón) en kanji en lugar de en inglés. El sesgo hacia EE. UU. es esperable en un corpus alimentado en parte por un rastreo en inglés y por GitHub, cuya base global de desarrolladores sigue concentrándose en EE. UU.; el segundo lugar de Japón fue la sorpresa mayor, y coincide con un patrón más amplio en el conjunto de datos subyacente — los niveles de creadores de TikTok y de Common Crawl de este mismo índice también sobrerrepresentan cuentas japonesas y en idioma japonés respecto a su tamaño general.
El campo de ubicación como bio, tarjeta de presentación y chiste interno
No toda ubicación completada es un lugar. De las 1.561 entradas no vacías:
| Patrón | Proporción | Cantidad |
|---|---|---|
| Contiene un emoji | 4.3% | 67 |
| Una broma, respuesta que no es un lugar ("Earth", "Metaverse", "Everywhere", "Internet") | 1.7% | 27 |
| Coordenadas GPS crudas en lugar de un nombre de lugar | 0.4% | 6 |
| Información de contacto o texto de consulta comercial | 1.0% | 15 |
El mejor ejemplo de todos pertenece a una empresa, no a una persona: @Meta, 9,9 millones de seguidores, indica su ubicación en X como "Metaverse." No está sola — las cuentas de desarrolladores @jradoff (303.743 seguidores) y @thealphadex (38.032 seguidores) hicieron lo mismo, sin previo acuerdo evidente ni coordinación. "Earth" aparece 6 veces distintas en nuestra muestra, incluida en @AFPphoto, una cuenta de agencia de noticias con 202.037 seguidores que en su lugar optó por "worldwide." Un puñado de cuentas convirtió el campo directamente en una tarjeta de presentación — una cuenta japonesa de ilustración que indica una dirección de Gmail y "DM for commission inquiries" donde debería ir una ciudad — y seis escribieron pares crudos de latitud/longitud, uno con el prefijo alemán "ÜT" (Übersetzung/ubicación traducida — probablemente un artefacto de un cliente de X no anglófono), incluyendo uno que señala un punto en Ámsterdam con precisión de seis decimales.
Qué muestra esto, y qué no
Lo que se sostiene: la ubicación es la única señal de completitud de perfil en esta serie donde el nivel "ordinario" de Common Crawl supera al nivel "notable" de Wikidata, y las normas de red profesional de GitHub producen la tasa de completitud más alta de todos los niveles medidos. El gradiente de alcance (más seguidores, más verificación → perfil más completo) se mantiene para la ubicación, solo que de forma menos pronunciada que para la bio o la verificación.
Qué lo limita:
- Esto es una muestra, no un censo. A diferencia de los otros estudios de esta serie, la ubicación no está expuesta por la API de búsqueda masiva — solo aparece en una búsqueda de perfil en vivo por cuenta individual, así que extrajimos una muestra estratificada de 2.482 cuentas (en 8 niveles y 6 franjas de seguidores) en lugar de consultar el índice completo de 820.548 perfiles. Con aproximadamente 590–600 cuentas por nivel principal, hay que esperar un margen de unos pocos puntos porcentuales en la tasa de completitud de cualquier nivel individual, no una precisión de nivel censal.
- La clasificación por país es una coincidencia de texto por palabras clave, poco precisa, no geocodificación. Pudimos asignar con confianza un país a 54,4% de las ubicaciones completadas; el resto son nombres de ciudad ambiguos sin marcador de país, respuestas regionales, escrituras no anglófonas que nuestra lista de palabras clave no cubría, o directamente algo que no es un lugar. Trate la tabla de países como un piso de la concentración geográfica real, no como un mapa completo.
- La ubicación es texto libre no verificado, escrito por el usuario. X no hace nada para confirmar que sea real, actual o siquiera un lugar — que es exactamente lo que hace posibles los hallazgos de respuestas en broma y coordenadas, pero también significa que cada número aquí describe lo que las cuentas dicen, no dónde están verificablemente.
- El corpus en sí está sembrado y sesgado por notabilidad, la misma advertencia que en cada estudio de esta serie — vea el artículo sobre Common Crawl para lo que eso cambia y no cambia sobre la población subyacente.
Fuentes
Metodología
Extrajimos una muestra estratificada de nombres de usuario de la API de búsqueda en vivo de el conjunto de datos de usuarios de X, dividida entre 8 niveles de origen (con más peso proporcional para los dos más grandes, Wikidata y Common Crawl) y 6 franjas de seguidores espaciadas logarítmicamente por nivel (0–9, 10–99, 100–999, 1.000–9.999, 10.000–99.999, 100.000+), para evitar sobremuestrear tanto las mega-cuentas como la larga cola. Eso produjo 2.482 nombres de usuario únicos. Luego consultamos individualmente el endpoint en vivo x_profile para cada una — el único lugar donde se expone el campo location de este conjunto de datos — registrando la ubicación, el conteo de seguidores actual y el estado de verificación de cada búsqueda exitosa (2.462 de 2.482, una tasa de resolución del 99,2%; el resto eran privadas, suspendidas o dieron timeout).
La clasificación por país usó una lista de palabras clave construida a mano (nombres de países, gentilicios y aproximadamente 25 ciudades principales por país, más una expresión regular de abreviaturas de estado de EE. UU. para entradas tipo Ciudad, ST) comparada sin distinguir mayúsculas/minúsculas contra cada cadena de ubicación — deliberadamente conservadora, así que las entradas que no pudimos hacer coincidir con confianza se dejaron sin clasificar en lugar de adivinarse. La detección de patrones sin sentido usó una verificación de categoría de símbolo Unicode para emojis, una expresión regular de coordenadas decimales para cadenas GPS, y una lista de coincidencia exacta para respuestas de broma comunes.
¿Quiere hacer su propio corte de datos? El conjunto de datos de usuarios de X es consultable directamente, la guía cómo hacer scraping de Twitter/X cubre tanto la búsqueda masiva como las llamadas por perfil individual a x_profile usadas aquí, y los precios incluyen el plan gratuito. Vea también el resto de esta serie: el usuario más prolífico de X es una máquina, el límite real de seguidos de X es 7.500, un desarrollador al azar tiene 5 veces más probabilidades que una persona notable de tener el check azul, lo que revelan las bios de X, cómo el nivel de Common Crawl cambió nuestro corpus de X, y la economía de atención de X es más desigual que la riqueza de cualquier país.
Preguntas frecuentes
What share of X profiles fill in a location?
63.4% in our sample — 1,561 of 2,462 successfully-looked-up profiles had a non-empty location field. Fill rate climbs with reach: 55.0% under 100 followers, up to 69–74% above 1,000 followers, and 73.1% for verified accounts versus 60.7% for unverified ones.
Do notable X accounts fill in their location more than ordinary ones?
No — and that's the surprise. Wikidata's curated, notable-people tier fills in location 51.2% of the time, the lowest of any major tier we sampled. Our Common Crawl tier, discovered through ordinary open-web mentions rather than notability, fills it in 64.8% of the time — a 13.6-point gap in the opposite direction from bio and verification, both of which run higher for the curated tier.
Why isn't location in Crawlora's bulk X users search API?
It simply isn't stored in the bulk search/item records (which carry username, bio, follower counts, verification and source tier) — only a live, per-account profile lookup (the x_profile endpoint) returns it. That's why this study used a 2,482-account stratified sample with individual lookups rather than a full-corpus query like the rest of this series.
What weird answers do X accounts put in their location field?
4.3% of filled-in locations contain an emoji, 1.7% are a joke non-place answer like "Earth," "Metaverse," "Everywhere" or "Internet," and 0.4% are raw GPS coordinates instead of a place name. The company account @Meta (9.9 million followers) lists its location as "Metaverse."
Which countries do the most X accounts in this corpus say they're from?
The United States leads at 23.2% of the locations we could confidently classify to a country, followed by Japan (6.8%), the United Kingdom (5.7%), Brazil, India, Germany, France and Canada. We could only classify 54.4% of filled-in locations with confidence — the rest are ambiguous city names, regional answers, or non-place text.
Is this location data representative of all X users?
No, for two compounding reasons. First, the underlying corpus is seeded from notable/curated sources plus open-web mentions, not a random sample of X's 600M+ users. Second, this specific study draws a 2,482-account stratified sample (not a full census) because location requires an individual profile lookup per account rather than a bulk query, so tier-level shares carry a sampling margin of a few points rather than census-level precision.