Tony Wang5 分で読めますAirbnb稼働率推定が2方向で外れ、たまたま打ち消し合っていた話
レビューベースの稼働率モデルはオースティンで60%、AirDNAの54%に近い値でした。実は偏ったサンプルと過少計上が偶然打ち消し合っただけです。
これまで見てきたスクレイピングされたAirbnbデータセットからの稼働率推定——今回までの私たち自身のものも含めて——はすべて同じ形をしています。予約カレンダー自体は公開されていないため、リスティングがどれくらいの頻度でレビューされるかから市場がどれくらい埋まっているかを推測する、というものです。私たちはまさにそのモデルを作り、オースティンで実行し、業界標準であるAirDNAの数字にかなり近い答えを得ました。それは「検証済み」と呼びたくなるほどでした。しかし、そうではありませんでした。この近似がなぜモデルの精度ではなく興味深い発見なのか、その理由を説明します。
一見勝利に見えた数字
検索順位上位80件のオースティンのリスティング
有料ティアの業界ベンチマーク
年間約82泊分の予約
2時間で作ったモデルと、有料でカレンダー裏付けのある業界プロダクトとの差がわずか6ポイントというのは、静かな勝利のように見えます。しかし違います。具体的で検証可能な理由があります。私たちのサンプルとモデルは互いに逆方向に間違っており、たまたま部分的に打ち消し合っただけなのです。
小さな1つの誤りではなく、2つの別々の誤り
誤り1——サンプルは意図的に繁盛している。 Airbnbの検索エンドポイントは関連性順にランク付けされた結果を返します。人々が実際に目にするリスティングは、予約数やレビュー数が多いものです。なぜならランキングアルゴリズムがまさにそれを評価するからです。サンプリングした80件のリスティングの半数は、6〜11カ月で60件のレビューを積み上げていました——月あたり5〜10件のレビュー——これは正真正銘の繁盛リスティングで、モデルの70%上限にそのまま突き当たります。AirDNAとInside Airbnbは、市場内のすべてのリスティングについて計算します。ほとんど予約されない何千件ものリスティングも含めてです。80件の検索順位ベースのサンプルは、常に実際の市場よりも繁盛しているように見えます。
誤り2——レビューベースのモデルはそれ自体で過小に数える。 すべての滞在が公開レビューを生むわけではなく(私たちのモデルはおおよそ半数がそうすると仮定しています)、短期滞在やオフシーズンの滞在は最もレビューされにくいものです。これにより、レビューから推測された稼働率の数字は、実際に起きたことに対して下方に押し下げられます。
幸運な打ち消し合いのない検証
サンプリングとモデリングの両方が正確であれば、宿泊単価の比較も同じ「十分に近い」という結論を語るはずです。しかし、そうはなりません——それを救ってくれる相殺的な誤りが存在しないからです。
中央値、Airbnbの検索フィールドより
私たちの生の数値より約2.5倍低い
これが決め手です。あるメトリック(稼働率)が検証されたように見え、密接に関連する別のメトリック(価格)が同じモデリング上の近道によって明らかにずれている場合、正直な読み方は「今回はたまたま運が良かった」であって、「この手法はうまくいく」ではありません。
私たちが次に行ったこと
以来、Airbnb自身のカレンダーエンドポイントがすでに返していた日単位の空室状況を取得するバックエンドの修正を出荷しました(それまでは月単位のスタブにまで解析が縮小されていました)。これにより、レビュー投稿頻度による推測全体を、日ごとの予約済み/空室の実際のカウントに置き換えます——AirDNAのビジネス全体が土台としているのと同じ種類の修正を、ブラウザ自動化パイプラインではなく構造化APIを通じて行っただけです。続報では、同じオースティンのサンプルを実際のカレンダーにかけ直し、レビューベースの推測が両方向にどれだけ外れていたかを正確に示す予定です——今回の記事ではまだ正直にできなかった比較です。
実際のAirbnbデータを取得——日単位のカレンダー空室状況を含む
検索、部屋の詳細、レビュー、そして今では実際の日単位カレンダー空室状況を、構造化JSONとして取得できます。ブラウザ自動化は不要で、成功課金制です。
よくある質問
レビューベースのAirbnb稼働率推定はどれくらい正確ですか?
オースティンの80件のリスティングのサンプルで平均稼働率60%となり、AirDNAが公表する過去12カ月の54%に近い数字でした。ただしこれはモデルが正確だからではありません。検索サンプルは繁盛していてレビューが多いリスティングに偏っており(稼働率を押し上げる)、レビューベースのモデルはレビューされない滞在を過小に数えます(押し下げる)。この2つの誤差が部分的に打ち消し合っただけです。
なぜ宿泊単価の比較では同じ「十分に近い」という結果にならないのですか?
それを救う相殺的な誤りが存在しないためです。私たちの生の検索価格の中央値は657ドルとなり、AirDNAの宿泊単価ADR265ドルやInside Airbnbの掲載価格454ドルに対して約2.5倍の水増しでした。Airbnbの検索結果の価格フィールドは、清潔な宿泊単価ではなく、手数料や複数泊分の合計を含んでいるためです。
この問題は修正されましたか?
はい。Crawlora の Airbnb API は現在、実際の日単位カレンダー空室状況を返しています(2026年6月23日出荷)。これにより、レビュー投稿頻度による推測を、日ごとの予約済み/空室の実際のカウントに置き換えました。AirDNA自身の製品が土台としているのと同じ根本的なシグナルです。