Tony Wang4 min de lecturaTodo dataset público de X que has visto está sesgado hacia la fama — incluido el nuestro
Nuestro dataset de X está sembrado con notables: solo 19.6% tiene menos de 100 seguidores vs. ~50% en investigación publicada.
La mayoría de los datasets públicos de X/Twitter —incluido el nuestro— se construyen partiendo de alguna lista de cuentas que vale la pena indexar y expandiéndose desde ahí. Es una decisión de ingeniería razonable. También significa que el dataset resultante no se parece en nada a la población real de la plataforma, y lo honesto es mostrar exactamente cuánto, usando nuestros propios datos como ejemplo en lugar de señalar el dataset de otro.
Cómo luce nuestro índice sembrado
Lo que dice en cambio la investigación más amplia sobre X/Twitter
Muestra académica de 2023, mediana ≈99 seguidores
Ambas cifras son internamente consistentes con la forma en que se construyeron. Nuestro índice está sembrado a partir de personas lo bastante notables como para tener una entrada en Wikidata, o lo bastante técnicas como para vincular un handle de X en GitHub: una población genuinamente útil para, digamos, encontrar la cuenta de una figura pública o de un desarrollador, y genuinamente no representativa para responder «¿cómo luce una cuenta típica de X?».
La parte que vale la pena generalizar
Esto no es una queja sobre nuestro propio dataset: ya está documentado con honestidad en los propios comentarios del código fuente del dataset, que es precisamente la razón por la que fue fácil escribir este artículo. El punto generalizable: cualquier dataset de perfiles públicos de una plataforma social construido mediante búsqueda, descubrimiento o una semilla de «personas notables» —índices de creadores de TikTok, extracciones de perfiles/empresas de LinkedIn, directorios de negocios de Instagram, datasets de X/Twitter como el nuestro— hereda un sesgo hacia la fama por construcción, y rara vez se plantea con la claridad de «esta es la brecha real entre nuestras cifras y una estimación más amplia de la población».
Si una cifra como «la cuenta mediana tiene N seguidores» está haciendo un trabajo real dentro de una decisión —dimensionar una campaña de influencers, comparar tu propia cuenta, juzgar qué tan nicho es un tema por quién habla de él—, la primera pregunta que hay que hacer es con qué se sembró el dataset del que salió esa cifra, no solo qué tan grande es el dataset.
Consulta nuestro dataset de perfiles de X/Twitter — sesgo revelado desde el principio
796,611 perfiles públicos, sembrados a partir de fuentes de personas notables y desarrolladores, y documentados como tal. Bandas de seguidores, verificación, biografía y antigüedad de cuenta como facetas en JSON estructurado.
Preguntas frecuentes
¿Un dataset público de perfiles de X/Twitter es representativo de la plataforma?
Por lo general no, y el nuestro es un ejemplo claro. Nuestro dataset de 796,611 cuentas está sembrado a partir de personas notables en Wikidata y handles vinculados a GitHub, así que solo el 2.4% de las cuentas tiene cero seguidores y el 19.6% tiene menos de 100, frente a la investigación académica publicada sobre cuentas activas de Twitter, que sitúa a cerca de la mitad de las cuentas activas por debajo de 100 seguidores (mediana cercana a 99).
¿Por qué ocurre esto?
Cualquier dataset construido mediante descubrimiento, búsqueda o una lista semilla de «personas notables» hereda un sesgo hacia la fama por construcción: es más fácil indexar cuentas que ya son independientemente encontrables. Esto no es exclusivo de los datasets de X/Twitter; el mismo patrón aparece en índices de creadores de TikTok y otros datasets de perfiles sociales construidos de la misma manera.
¿Cómo se hizo esta comparación?
Citando investigación de terceros publicada sobre la distribución de seguidores en cuentas activas junto con las cifras documentadas de nuestro propio dataset: una comparación entre datasets, no una muestra aleatoria fresca extraída por nosotros.