Tony Wang10 min de lecturaBuscar «Meta AI» en las bios de X da 14.673 resultados. Buscar solo «AI» también.
Contamos menciones a labs de IA en 697.439 bios de X. Nombres de dos palabras se pierden en el ruido; solo tokens como OpenAI resisten.
«¿Qué laboratorio de IA tiene más gente en X?» suena como una pregunta que se podría responder buscando nombres de empresas en las bios y contando. Teníamos 697.439 bios de X no vacías en un índice de búsqueda e intentamos exactamente eso. La tecnología de búsqueda rompió la pregunta antes de que lo hicieran los datos.
Las comillas no sirven de nada
El endpoint de búsqueda de usuarios de X toma un parámetro q documentado como búsqueda de texto completo sobre el nombre de usuario, el nombre, la bio y la ubicación. En la práctica es una búsqueda por token con OR: coincide con bios que contengan cualquiera de las palabras escritas, no la frase exacta, y encerrar la consulta entre comillas no cambia nada. Busca "Meta AI" y en realidad estás buscando Meta OR AI:
"Meta AI" devuelve más resultados que el simple AI — la consulta coincide con toda bio que tenga la palabra «AI», más un puñado con «Meta». "Stability AI," "Perplexity AI," "Mistral AI," "Moonshot AI" y "Microsoft AI" caen todos en el mismo rango de 14.000–15.000 por la misma razón: cualquier nombre de dos palabras donde una de ellas sea «AI» es funcionalmente indistinguible de buscar «AI» sola. "Google DeepMind" da un número menor pero el mismo fallo — 2.218 resultados, dominados por la palabra común «Google», no por la distintiva. Ninguno de estos sirve como recuento de menciones de una empresa. Poner una frase entre comillas, la forma intuitiva de buscar el nombre exacto de una empresa, no hace absolutamente nada en este endpoint.
Lo que queda: tokens únicos distintivos, y cuánto de cada uno es real de verdad
Si eliminas la mitad de palabra común del nombre y buscas solo el token distintivo — DeepMind en vez de "Google DeepMind", OpenAI en vez de "Open AI" — los números se vuelven pequeños, específicos y verificables a mano:
Los números pequeños son contables, así que leímos cada resultado de cada token — hasta 30 por token, o el conjunto completo en los tokens con menos de 30 — y clasificamos cada uno a mano como «genuinamente relacionado con el laboratorio» (la cuenta oficial, o una bio que nombra un puesto ahí) o «colisión» (una persona, lugar o producto sin relación que resulta compartir la misma palabra):
| Token | Bios que coinciden | Tasa de check azul | Lectura de los resultados reales |
|---|---|---|---|
| OpenAI | 373 | 68,6 % | Casi todos los resultados son la cuenta oficial o una bio que nombra un puesto — «Codex @OpenAI», «research @openai». El token más limpio del conjunto. |
| DeepMind | 150 | 49,3 % | Mismo patrón: científicos e ingenieros de investigación que nombran a Google DeepMind. La verificación es menor porque muchos son académicos, no personal que recibe el check gratuito a gran escala. |
| xAI | 79 | 69,6 % | Mayormente genuino, pero con colisiones reales: un identificador de fan-art japonés, una cuenta sin relación literalmente llamada «XAI», y una bio que usa «XAI» como la sigla académica de «explainable AI» (IA explicable). |
| Anthropic | 51 | 68,6 % | Cerca de tres cuartas partes son personal, exempleados o inversores; el resto son periodistas que cubren la empresa, cuentas de broma y una investigadora en ecología que usa «anthropic» en su sentido original («anthropic stress», estrés antropogénico). |
| Cohere | 31 | 67,7 % | Mayormente genuino, salvo dos empresas sin relación que también usan la palabra: una firma de redes inalámbricas 5G llamada Cohere Technologies y una marca de espacios de coworking llamada Cohere Coworking. |
| Mistral | 24 | 62,5 % | Menos de tres cuartas partes son genuinas. El resto: una red de autobuses de Toulon (réseau Mistral), una universidad chilena y una librería de Santiago, ambas nombradas en honor a la poeta Gabriela Mistral, un premio de una presentadora de radio chilena que lleva su nombre, y un restaurante llamado Mistral en Princeton. |
| DeepSeek | 10 | 80,0 % | El token en sí es limpio — ninguna empresa sin relación colisiona con él — pero solo 2 de los 10 resultados son la empresa o una persona empleada. El resto son personas que mencionan DeepSeek como una herramienta que usan, o fans. |
| Qwen | 8 | 50,0 % | Misma forma que DeepSeek: la cuenta oficial más una excolaboradora identificable, y el resto son usuarios que ejecutan el modelo o «embajadores» del programa, no empleados. |
Hay dos cosas que vale la pena detenerse a pensar. Primero, la tasa de verificación no refleja qué tan «real» es un token — Mistral y xAI muestran tasas de check azul similares a las de los tokens limpios, porque la verificación indica si alguien pagó 8 dólares, no si su bio trata sobre la empresa buscada. Segundo, la fracción de resultados que corresponden a una persona empleada de verdad, en vez de una fan, una usuaria o una colisión sin relación, cae en picada para los dos tokens más pequeños: al revisar el origen, DeepSeek y Qwen se relacionan con empleados en apenas un 20–40 % de los casos, frente a más del 90 % en OpenAI y DeepMind.
Dos tokens para los que no publicamos una cifra
Kimi (el modelo de Moonshot AI) devuelve 17 resultados en bios. No lo reportamos como un recuento de menciones, porque al leer los resultados casi ninguno trata sobre el laboratorio de IA — Kimi es un nombre de pila común y un identificador de X común, y la muestra estaba dominada por personas sin relación, un actor japonés, una cuenta de fans de un sello musical y una productora de clips de dominatrix profesional que lo usa como apodo. Dos resultados sí eran genuinamente las cuentas oficiales de producto de Moonshot.
Moonshot (como en Moonshot AI, el laboratorio detrás de Kimi) devuelve 8 resultados — y al leerlos se ve que el token es peor que inútil: una red de podcasts, una productora de cine, una marca de conferencias de startups africanas, una organización sin fines de lucro de investigación en biología, un proyecto amateur de nanotecnología y el propio eslogan de Google X «the moonshot factory» superan todos al laboratorio de IA. Solo uno de los ocho es genuinamente Moonshot AI. Publicar «Moonshot: 8 menciones» sin ese contexto tergiversaría el hallazgo más que no publicar ninguna cifra.
La forma honesta de ver esto, no una tabla de posiciones
Sería fácil convertir la tabla de tokens de arriba en «OpenAI le gana a Anthropic 373 a 51 en X» — y ese enfoque estaría mal en todos los ejes que importan. Las cifras no son comparables entre laboratorios (OpenAI es más antiguo, más grande y tiene más exempleados que conservaron la mención en su bio), no son un recuento de plantilla (373 menciones en bios frente a un laboratorio con miles de empleados es un error de redondeo, y la mayoría de las bios nunca menciona un empleador — mira nuestro estudio sobre cómo está desapareciendo la propia bio de X), y — como muestra la sección anterior — una parte significativa incluso de los tokens «limpios» no corresponde a empleados en absoluto.
Lo que los números sí muestran de forma confiable: las bios de X son una señal débil y muy sesgada para saber «quién trabaja en un laboratorio de IA». Las cifras absolutas son minúsculas frente a un corpus de 697.439 bios. La tecnología de búsqueda no puede separar un nombre de marca de dos palabras de la palabra común que contiene, lo cual descarta a la mayoría de los laboratorios que alguien realmente querría buscar. Y los laboratorios que sí aparecen se inclinan fuertemente hacia círculos occidentales, de habla inglesa, de desarrolladores e investigadores — DeepSeek, Qwen, Kimi y Moonshot apenas son visibles aquí no porque los laboratorios chinos tengan menos personal, sino porque este índice está sembrado a partir de Wikidata, GitHub y el grafo de búsqueda en inglés de X, lo cual submuestrea precisamente a esa población. Ese sesgo, y no una brecha real de plantilla, es la historia más honesta.
Qué muestra esto, y qué no
Lo que creemos que se sostiene: los tokens de nombre de marca únicos y distintivos (OpenAI, DeepMind, Anthropic, Cohere) devuelven conjuntos pequeños y mayormente genuinos de menciones en bios, y la proporción de resultados genuinos varía mucho según el laboratorio — desde más del ~90 % hasta un ~20–40 % en los tokens más pequeños. Los nombres de dos palabras colapsan en ruido de búsqueda y no son utilizables en absoluto. Dos tokens (Kimi, Moonshot) están dominados por colisiones sin relación, y los reportamos como no medibles en vez de dar una cifra engañosa.
Qué lo limita:
- Esto es un recuento de menciones en bios, no un censo de empleados. Una mención no es prueba de empleo actual (muchos resultados dicen «prev» o «ex-»), y la ausencia de una mención no es prueba de que alguien no trabaje ahí — la mayoría de las bios no nombra ningún empleador.
- Las proporciones de relevancia laboral en la tabla son estimaciones a partir de una muestra pequeña leída a mano, no un clasificador sistemático — se leyeron entre 8 y 30 resultados por token, con mayor incertidumbre en los tokens más pequeños (DeepSeek, Qwen).
- El conjunto de datos es un índice sembrado de cuentas de X establecidas/detectables, no una muestra aleatoria ni un censo — consulta el conjunto de datos de usuarios de X para conocer la siembra y su sesgo occidental/de habla inglesa. Es plausible que ese sesgo explique la mayor parte de la brecha de visibilidad entre laboratorios occidentales y chinos que se observa aquí.
- Solo publicamos agregados — recuentos de menciones en bios y tasas de verificación por token, sin cuentas individuales ni texto de bio vinculado a personas identificadas.
Fuentes
Metodología
Consultamos el parámetro q del endpoint de búsqueda de usuarios de X (texto completo sobre nombre de usuario, nombre, bio y ubicación) con has_bio=true para cada nombre candidato de laboratorio de IA, primero como una frase de dos palabras entre comillas y luego como su token único distintivo. El endpoint documenta q como búsqueda de texto completo; empíricamente es una búsqueda por token con OR sobre las palabras de la consulta, así que una frase de dos palabras entre comillas donde una de las palabras es común (como «AI» o «Google») devuelve un conjunto de resultados dominado por esa palabra común en vez de por la frase. Confirmamos esto comparando consultas de dos palabras entre comillas con una consulta de control para la palabra común sola, y encontramos totales casi idénticos ("Meta AI": 14.673 frente a AI sola: 14.112).
Para cada consulta de un solo token que devolvió un total menor a 30, leímos todos los resultados; para los tokens con 30 o más, leímos una página de 30 resultados ordenada por relevancia. Cada resultado se clasificó a mano como genuinamente relacionado con el laboratorio (la cuenta corporativa oficial, o una bio que nombra un puesto actual o pasado ahí) o como una colisión (una persona, lugar, producto o uso de la misma palabra sin relación). También extrajimos el atributo is_blue_verified para cada token. El tamaño del corpus (796.611 perfiles en total, 697.439 con bio no vacía) y todos los recuentos se consultaron en vivo y están vigentes a la fecha de este estudio; un conjunto de datos de este tamaño y una superficie de consulta como esta cambian con el tiempo, así que una repetición podría devolver totales ligeramente distintos.
¿Quieres hacer tu propio corte de datos? El conjunto de datos de usuarios de X documenta el patrón de consulta y su sesgo occidental/de habla inglesa con más profundidad; nuestro estudio sobre cómo está cambiando la propia bio de X cubre el declive más amplio del formato de bio «puesto + empleador» del que depende este estudio.
Preguntas frecuentes
¿Se puede buscar una empresa de IA específica por nombre en las bios de X?
Solo si el nombre es un único token distintivo. La búsqueda de texto completo en bios de X funciona por token con OR, no por frase, así que poner entre comillas un nombre de dos palabras como «Meta AI» no cambia nada — coincide con cualquier bio que contenga «Meta» O «AI», lo que devuelve 14.673 resultados, casi idéntico a buscar solo la palabra «AI» (14.112). Tokens únicos como OpenAI, DeepMind, Anthropic y Cohere funcionan bien; los nombres de marca de dos palabras construidos con una palabra inglesa común no.
¿Cuántas bios de X mencionan trabajar en OpenAI, Anthropic o DeepMind?
Entre 697.439 bios de X no vacías: OpenAI aparece en 373, DeepMind en 150, Anthropic en 51, Cohere en 31. Al leer los resultados a mano, las bios de OpenAI y DeepMind son casi todas de personal o de la cuenta oficial; Anthropic es cerca de tres cuartas partes personal, exempleados e inversores, con algunos periodistas y colisiones sin relación mezclados. Son recuentos de menciones en bios, no un censo de empleados — la mayoría de las bios de X nunca nombra un empleador.
¿Por qué no hay un recuento limpio de menciones para DeepSeek, Qwen, Kimi o Moonshot?
DeepSeek (10 resultados) y Qwen (8 resultados) son tokens limpios, pero mayormente devuelven usuarios que mencionan el producto, no empleados — solo 2-3 resultados en cada caso son genuinamente la empresa o una persona colaboradora real. Kimi (17 resultados) y Moonshot (8 resultados) son peores: Kimi es un nombre de pila e identificador de X comunes, y Moonshot choca con una red de podcasts, una productora de cine y la propia división «moonshot factory» de Google X. Reportamos Kimi y Moonshot como no medibles en vez de publicar una cifra engañosa para cualquiera de los dos.
¿Esto muestra qué laboratorio de IA tiene más gente en X?
No, y evitamos deliberadamente ese enfoque. Las cifras no son comparables entre laboratorios (los labs más antiguos y grandes acumulan más menciones de exempleados), no son un recuento de plantilla (373 menciones en bios frente a una empresa con miles de empleados es un error de redondeo), y los laboratorios chinos (DeepSeek, Qwen, Kimi, Moonshot) apenas son visibles aquí — casi con certeza porque este índice de X está sembrado a partir de Wikidata, GitHub y búsquedas en inglés, no porque esos laboratorios empleen a menos personas.