Tony Wang5 min de lecturaNuestra estimación de ocupación de Airbnb estaba mal en dos direcciones que se cancelaron
Un modelo por reseñas dio 60% de ocupación en Austin, cerca del 54% de AirDNA. No es validación: muestra sesgada y modelo subcontador se cancelaron.
Toda estimación de ocupación que hayas visto a partir de un dataset de Airbnb obtenido por scraping —la nuestra incluida, hasta ahora— tiene la misma forma: inferir qué tan lleno está un mercado a partir de la frecuencia con la que se reseñan los anuncios, porque el calendario de reservas en sí no es público. Construimos exactamente ese modelo, lo aplicamos a Austin y obtuvimos una cifra lo bastante cercana al número estándar de la industria, AirDNA, como para tentarnos a llamarlo validado. No lo era. Aquí explicamos por qué la coincidencia casi exacta es el hallazgo interesante, no la precisión del modelo.
La cifra que parecía una victoria
80 anuncios de Austin ordenados por búsqueda
el benchmark de pago de la industria
~82 noches reservadas al año
Una diferencia de 6 puntos entre un modelo de dos horas y un producto de pago respaldado por calendario de la industria parece una victoria silenciosa. No lo es, por una razón concreta y verificable: nuestra muestra y nuestro modelo están equivocados en direcciones opuestas, y por casualidad se cancelaron parcialmente entre sí.
Dos errores independientes, no uno pequeño
Error uno — la muestra está ocupada a propósito. El endpoint de búsqueda de Airbnb devuelve resultados ordenados por relevancia: los anuncios que la gente realmente ve son los que tienen más reservas y más reseñas, porque eso es lo que premian los algoritmos de ranking. La mitad de nuestros 80 anuncios muestreados habían acumulado 60 reseñas en 6-11 meses — entre 5 y 10 reseñas al mes — lo que es genuinamente un anuncio muy activo, y se fue directo al tope del 70% de nuestro modelo. AirDNA e Inside Airbnb calculan sobre todos los anuncios de un mercado, incluidos los miles que apenas se reservan. Una muestra de 80 anuncios ordenada por búsqueda siempre parecerá más activa que el mercado real.
Error dos — el modelo basado en reseñas subestima por sí solo. No toda estancia genera una reseña pública (nuestro modelo asume que aproximadamente la mitad sí), y las estancias cortas o fuera de temporada son las que con más probabilidad quedan sin reseñar. Eso empuja hacia abajo la ocupación inferida por reseñas respecto a lo que realmente ocurrió.
La comprobación que no tiene una cancelación afortunada
Si el muestreo y el modelado fueran ambos precisos, la comparación de tarifa por noche debería contar la misma historia de "suficientemente cerca". No lo hace — porque no hay ningún error compensatorio que la salve:
mediana, del campo de búsqueda de Airbnb
~2.5x más bajo que nuestra cifra bruta
Ahí está la señal. Cuando una métrica (ocupación) parece validada y una métrica estrechamente relacionada (precio) está claramente desviada por el mismo atajo de modelado, la lectura honesta es "tuvimos suerte una vez", no "el método funciona".
Qué hicimos después
Desde entonces lanzamos una corrección de backend que extrae la disponibilidad a nivel de día que el propio endpoint de calendario de Airbnb ya devuelve (antes se analizaba hasta reducirla a un resumen a nivel de mes). Eso sustituye toda la estimación por velocidad de reseñas con un conteo real de reservado/disponible por día — el mismo tipo de corrección sobre el que está construido todo el negocio de AirDNA, solo que vía una API estructurada en lugar de un pipeline de automatización de navegador. Un próximo artículo aplicará la misma muestra de Austin al calendario real y mostrará exactamente cuán equivocada estaba la estimación basada en reseñas, en ambas direcciones — la comparación que este artículo todavía no podía hacer honestamente.
Obtén datos reales de Airbnb — incluida la disponibilidad real de calendario a nivel de día
Búsqueda, detalle de anuncio, reseñas y ahora disponibilidad real de calendario por día, como JSON estructurado — sin automatización de navegador, facturado con pago por éxito.
Preguntas frecuentes
¿Qué tan precisa es una estimación de ocupación de Airbnb basada en reseñas?
La nuestra dio 60% de ocupación media para una muestra de 80 anuncios en Austin, frente al 54% publicado por AirDNA a doce meses — cerca, pero no porque el modelo sea preciso. La muestra de búsqueda se inclina hacia anuncios muy activos y con muchas reseñas (sesgando la ocupación hacia arriba), mientras que el modelo basado en reseñas subestima las estancias que nunca se reseñan (sesgándola hacia abajo); los dos errores se cancelaron parcialmente.
¿Por qué la comparación de tarifa por noche no muestra el mismo resultado de "suficientemente cerca"?
Porque no hay ningún error compensatorio que la salve. Nuestra cifra bruta de precio de búsqueda dio $657 de mediana, frente a los $265 de ADR por noche de AirDNA y los $454 de precio anunciado de Inside Airbnb — una inflación de aproximadamente 2.5x, ya que el campo de precio de búsqueda de Airbnb agrupa comisiones y totales de varias noches en lugar de devolver una tarifa por noche limpia.
¿Ya se corrigió esto?
Sí — la API de Airbnb de Crawlora ahora devuelve disponibilidad real de calendario a nivel de día (lanzado el 2026-06-23), sustituyendo la estimación por velocidad de reseñas con un conteo real de reservado/disponible por día, la misma señal subyacente sobre la que está construido el propio producto de AirDNA.