Tony Wang9 分で読めますXの「普通の」アカウントは著名アカウントより位置情報を入力している
Xアカウント2,462件の調査で63%が位置情報を入力。Common Crawl(65%)が厳選された著名アカウント(51%)を上回るという逆転が判明。
このシリーズの3つの研究は、同じパターンを見出してきました。Xアカウントのリーチが大きいほど、プロフィールはより充実するということです。認証済みアカウントは未認証アカウントよりbioを埋める頻度が高い。厳選された著名アカウントは、私たちの新しいCommon Crawlチャネルが通常のウェブ言及から発見したアカウントよりbioを埋める頻度が高い。私たちはもう一つの欄 — 位置情報 — でこのパターンが成り立つかを調べ、4回目の裏付けを期待していました。ところが、そのパターンが逆転する唯一の場所を見つけたのです。
位置情報はバルクデータには含まれない — アカウントごとに尋ねるしかなかった
このシリーズの他のすべての統計値は、私たちの公開検索APIから得られました。このAPIはバルクのファセットとフィルター済みのカウントを、個々のレコードを取得することなく即座に返します。位置情報はそうした欄の一つではありません。バルク検索とアイテムレコードはユーザー名、bio、フォロワー数、認証状態、ソースTierを載せていますが、位置情報は載せていません。それは、ライブでアカウントごとのプロフィールを個別に取得したレスポンスにのみ現れます。
そのため、この研究は先行する研究とは異なる作り方をしています。8つの主要な発見Tierと6つのフォロワー帯すべてにわたって抽出した2,482件のユーザー名の層化標本を、それぞれ個別に取得しました。2,462件が解決できました(99.2% — 16件は非公開または凍結、4件はタイムアウト)。そのうち位置情報が空だったのは901件、入力済みだったのは1,561件 — 全体の充填率は63.4%でした。
「普通」が「著名」を上回る唯一のシグナル
| 発見Tier | 標本サイズ | 位置情報の充填率 |
|---|---|---|
| GitHubユーザー | 583 | 76.8% |
| X検索(認証済み) | 202 | 70.3% |
| ジャーナリスト | 148 | 66.9% |
| Common Crawl | 599 | 64.8% |
| TrustMRRスタートアップ | 92 | 63.0% |
| TikTokクリエイター | 100 | 52.0% |
| Wikidata(厳選・著名) | 596 | 51.2% |
| Xフォローグラフ | 142 | 48.6% |
私たちのCommon Crawl研究では、そのTierのアカウントは厳選アカウントよりbioを埋める頻度が13ポイント低く(81.4% 対 91.8%)、Xの青バッジを持つ頻度は4分の1程度であることが分かりました。あの研究が測定したあらゆるシグナルにおいて、Common Crawlはより不完全で、より無名で、より普通に見えました。位置情報はその連続を破ります。Common Crawlアカウント(64.8%)は、Wikidataの厳選された著名アカウント(51.2%)よりも高い頻度でそれを載せています — bioとは逆方向に13.6ポイントの差です。
考えられる理由は、Common Crawlのアカウントの方が几帳面だからではありません。それぞれのTierが実際には何であるかによるものです。Wikidataは、百科事典の項目に載るほど著名な人々 — 政治家、経営幹部、アスリート — をこのインデックスに供給しており、その多くは広報チームやアシスタントを介してアカウントを運営しているか、あるいは名前と公開向けに書かれたbio以外のプロフィール設定欄には一切手を付けていません。位置情報は、著名人が受け入れる理由のないドキシングのリスクを招きます。対照的にCommon Crawlは、個人サイト、フォーラムのプロフィール、「フォローお願いします」というフッターなど、何らかの普通のウェブページが既にリンクしているという理由でアカウントを発見します。リンクをたどるクロールに発見されるきっかけとなる、自分自身を地図上に置くという日常的な習慣は、プロフィール欄に都市名を入力する傾向にもつながります。GitHubユーザーが当然のようにどのTierをも上回る(76.8%)のは、位置情報の一行がプロの開発者プロフィールの通常の一部であり、履歴書に都市名を載せさせるのと同じ本能だからです。
おなじみの勾配は依然として成り立つ — ただし弱まって
リーチはやはりプロフィールの充実度を予測します。以前の研究がbioと認証済みバッジについて示したのと同じです — 上記のTierの逆転は、どんな種類のアカウントが位置情報を埋めるかについてのものであり、フォロワーが多いことがそもそも欄を埋めることと相関するかどうかについてのものではありません。
| フォロワー帯 | 標本サイズ | 位置情報の充填率 |
|---|---|---|
| 100人未満 | 706 | 55.0% |
| 100〜999人 | 420 | 67.9% |
| 1,000〜9,999人 | 419 | 69.2% |
| 10,000〜99,999人 | 413 | 73.6% |
| 100,000人以上 | 391 | 69.3% |
| 認証状態 | 標本サイズ | 位置情報の充填率 |
|---|---|---|
| 認証済み(青バッジ) | 531 | 73.1% |
| 未認証 | 1,931 | 60.7% |
充填率は、最も小さいアカウントから数万人台の下限あたりまで18.6ポイント上昇し、その後横ばいになります — これはフォロー上限の研究とbioの研究が他のプロフィール欄について見出した「逓減するが確かに存在する」のと同じ形です。認証済みアカウントは未認証アカウントより12.4ポイント高く、このシリーズにおける認証済みバッジの通常の役割 — アカウントが公開プロフィールをどれだけ真剣に扱っているかの大まかな代理指標 — と一致します。
アカウントが自ら申告する場所
キーワードによって単一の国に確信を持ってマッチできた849件の位置情報(入力済み全エントリの54.4%)に絞ると — 残りは明確な国の手がかりのない都市名のみの言及、地域・大陸レベルの回答(「ヨーロッパ」「アフリカ」)、あるいは実質的に場所ですらないもの(下記参照)です。
| 国 | 分類済み位置情報に占める割合 |
|---|---|
| アメリカ合衆国 | 23.2% |
| 日本 | 6.8% |
| イギリス | 5.7% |
| ブラジル | 2.4% |
| インド | 2.4% |
| ドイツ | 2.2% |
| フランス | 2.0% |
| カナダ | 1.7% |
| スペイン | 1.1% |
| オーストラリア | 1.1% |
国に分類されなかった単一の文字列で最も多かったのは、英語圏かつテック・メディア寄りのコーパスから予想される通りの都市でした。サンフランシスコ(17件)、ロサンゼルス(14件)、ワシントンD.C.(13件)、ロンドン(12件)、ニューヨーク(12件) — さらに、英語ではなく漢字で「日本」と書いたプロフィールが13件ありました。米国への偏りは、英語圏のクロールとGitHub(そのグローバルな開発者基盤は今も米国に集中しています)から一部シードされたコーパスとしては予想通りです。日本が2位に入ったことはより大きな驚きであり、基礎となるデータセット全体に見られるより広いパターンと符合します — 同じインデックスのTikTokクリエイターTierおよびCommon Crawl Tierも、全体のサイズに対して日本人・日本語アカウントの比率が過大に高くなっています。
位置情報欄はbio、名刺、そして内輪ネタになる
入力済みの位置情報がすべて「場所」というわけではありません。1,561件の空でないエントリを通して見ると、次のようになります。
| パターン | 割合 | 件数 |
|---|---|---|
| 絵文字を含む | 4.3% | 67 |
| 冗談の、場所ではない回答(「Earth」「Metaverse」「Everywhere」「Internet」) | 1.7% | 27 |
| 地名の代わりに生のGPS座標 | 0.4% | 6 |
| 連絡先情報やビジネス問い合わせのテキスト | 1.0% | 15 |
一番の好例は、個人ではなく企業のものです。@Meta(フォロワー990万人)は、X上の位置情報を**「Metaverse」**としています。それだけではありません — 開発者アカウントの@jradoff(フォロワー303,743人)と@thealphadex(フォロワー38,032人)も、示し合わせた様子もなく自発的に同じことをしています。「Earth」は標本全体で6件別々に登場し、その中にはフォロワー202,037人のニュース通信社アカウント@AFPphotoも含まれます。こちらは代わりに「worldwide」を選びました。一握りのアカウントは、その欄をそのまま名刺に変えてしまいました — ある日本のイラストレーターアカウントは、都市名が入るべき場所にGmailアドレスと「DM for commission inquiries」を掲載していました — そして6件は生の緯度・経度のペアを書き込み、そのうち1件はドイツ語の略語「ÜT」(Übersetzung/翻訳された位置情報 — おそらく非英語のXクライアントの痕跡)を前に付け、その中にはアムステルダムのある地点を小数点以下6桁まで特定しているものもありました。
これが示すこと、示さないこと
成り立つと考えること: 位置情報は、このシリーズの中で「普通の」Common Crawl Tierが「著名な」Wikidata Tierを上回る唯一のプロフィール充実度シグナルであり、GitHubのプロフェッショナルなネットワークの規範が、測定した中で最も高い充填率を生み出します。リーチの勾配(フォロワーが多いほど、認証されているほど → より充実したプロフィール)は位置情報でも依然として成り立ちますが、bioや認証済みバッジほど急ではありません。
それを制限すること:
- これは標本であり、全数調査ではありません。 このシリーズの他の研究と異なり、位置情報はバルク検索APIでは公開されません — アカウントごとのライブなプロフィールルックアップにのみ現れるため、全820,548プロフィールのインデックス全体を照会するのではなく、2,482アカウント(8つのTier・6つのフォロワー帯にわたる)の層化標本を抽出しました。主要な各Tierおよそ590〜600アカウントという規模では、いずれか一つのTierの充填率に数パーセントポイントの誤差幅を見込むべきで、全数調査レベルの精度ではありません。
- 国の分類は緩やかな、キーワードベースのテキストマッチングであり、ジオコーディングではありません。 入力済みの位置情報のうち54.4%を確信を持って国に割り当てられましたが、残りは国の手がかりのない曖昧な都市名、地域的な回答、私たちのキーワードリストがカバーしていなかった非英語の文字体系、あるいは実質的に場所ではないものです。国の表は、実際の地理的集中の下限として扱ってください。完全な地図としてではありません。
- 位置情報は検証されていない、ユーザーが入力した自由記述です。 Xはそれが本物か、現在の情報か、そもそも場所であるかを確認するようなことは一切しません — まさにそれゆえに冗談の回答や座標といった発見が可能になっているのですが、同時に、ここにあるすべての数字はアカウントが何を申告しているかを表しているのであって、検証可能な意味でどこにいるかを表しているわけではないということでもあります。
- コーパス自体がシードされており、著名性に偏っています。 これはこのシリーズのすべての研究に共通する留保です — それが基礎となる母集団について何を変え、何を変えないかについては、Common Crawlの記事を参照してください。
出典
調査方法
X usersデータセットのライブ検索APIから、ユーザー名の層化標本を抽出しました。8つのソースTier(最大の2つ、WikidataとCommon Crawlから比例的に多く取得)と、Tierごとに対数間隔の6つのフォロワー帯(0〜9、10〜99、100〜999、1,000〜9,999、10,000〜99,999、100,000以上)に分割し、メガアカウントとロングテールのどちらも過剰に標本に含まれないようにしました。これにより2,482件のユニークなユーザー名が得られました。次に、このデータセットのlocation欄が公開される唯一の場所であるライブのx_profileエンドポイントを、それぞれ個別に照会し、成功した各ルックアップについて位置情報、現在のフォロワー数、認証状態を記録しました(2,482件中2,462件、解決率99.2%。残りは非公開、凍結、またはタイムアウトでした)。
国の分類には、手作業で構築したキーワードリスト(国名、住民を表す語、国ごとにおよそ25の主要都市、さらにCity, ST形式のエントリに対応する米国州略称の正規表現)を使い、各位置情報の文字列に対して大文字小文字を区別せずにマッチングしました — 意図的に控えめな方法で、確信を持ってマッチできなかったエントリは推測せず未分類のままにしました。ジャンクパターンの検出には、絵文字用のUnicodeシンボルカテゴリチェック、GPS文字列用の小数座標の正規表現、そしてよくある冗談の回答用の完全一致リストを用いました。
自分で独自の切り口を試してみたいですか? X usersデータセットは直接クエリでき、Twitter/Xのスクレイピング方法のガイドでは、バルク検索とここで使ったx_profileによるプロフィールごとの呼び出しの両方を扱っています。料金には無料枠があります。同じシリーズの他の記事もあわせてご覧ください。Xで最も多作な投稿者は機械、Xの本当のフォロー上限は7,500、ランダムな開発者は著名人より5倍青バッジを持ちやすい、X bioが明かすもの、Common Crawl TierがどうX corpusを変えたか、そしてXのアテンション経済はどの国の富の格差よりも不平等。
よくある質問
Xプロフィールのうちどれくらいが位置情報を入力していますか?
私たちの標本では63.4%です — 正常に取得できた2,462件のプロフィールのうち1,561件に空でない位置情報欄がありました。充填率はリーチとともに上昇し、フォロワー100人未満では55.0%、1,000人超では69〜74%、認証済みアカウントは73.1%、未認証アカウントは60.7%です。
著名なXアカウントは普通のアカウントより位置情報を入力していますか?
いいえ — それが驚きの点です。Wikidataの厳選された著名人Tierは位置情報を51.2%しか入力しておらず、サンプリングした主要Tierの中で最も低い数字です。通常のオープンウェブ上の言及から発見された、著名性とは無関係のCommon Crawl Tierは64.8%入力しています — bioと認証済みバッジ(どちらも厳選Tierの方が高い)とは逆方向に13.6ポイントの差です。
なぜ位置情報はCrawloraのXユーザー用バルク検索APIに含まれていないのですか?
そもそもバルク検索/アイテムレコード(ユーザー名、bio、フォロワー数、認証状態、ソースTierを含む)には保存されておらず、ライブのアカウントごとのプロフィールルックアップ(x_profileエンドポイント)でのみ返されるためです。そのため、この研究ではシリーズの他の研究のような全コーパスへの単一クエリではなく、個別ルックアップを用いた2,482アカウントの層化標本を使いました。
Xアカウントは位置情報欄にどんな奇妙な回答を入れていますか?
入力済みの位置情報のうち4.3%は絵文字を含み、1.7%は「Earth」「Metaverse」「Everywhere」「Internet」のような冗談の、場所ではない回答で、0.4%は地名の代わりに生のGPS座標です。企業アカウント@Meta(フォロワー990万人)は位置情報を「Metaverse」としています。
このコーパスで最も多くのXアカウントが出身地として挙げている国はどこですか?
確信を持って国に分類できた位置情報のうち、アメリカ合衆国が23.2%でトップ、次いで日本(6.8%)、イギリス(5.7%)、ブラジル、インド、ドイツ、フランス、カナダと続きます。入力済みの位置情報のうち確信を持って分類できたのは54.4%のみで、残りは曖昧な都市名、地域的な回答、または場所ではないテキストです。
この位置情報データはすべてのXユーザーを代表していますか?
いいえ、2つの理由が重なっています。第一に、基礎となるコーパスは著名・厳選されたソースとオープンウェブ上の言及からシードされたものであり、Xの6億人超のユーザーからのランダムな標本ではありません。第二に、この研究は位置情報の取得にアカウントごとの個別プロフィールルックアップが必要でバルククエリができないため、全数調査ではなく2,482アカウントの層化標本を用いており、Tierごとの割合には全数調査レベルの精度ではなく数ポイントの標本誤差が伴います。