Tony Wang6 min de lecturaCómo scrapear listados inmobiliarios en 2026 (API y Python)
Cómo scrapear listados inmobiliarios en 2026 — DIY con Python, no-code o una API estructurada para datos de Zillow, con bases legales.
La forma más rápida de scrapear listados inmobiliarios en 2026 es llamar a una API estructurada que devuelve JSON normalizado — resultados de búsqueda y detalles de la vivienda como precio, habitaciones, baños y dirección — en lugar de parsear páginas de portal muy cargadas de JavaScript y luchar contra defensas anti-bot. Puedes construir un scraper DIY, pero los grandes portales bloquean la automatización activamente, y el sector inmobiliario conlleva riesgos de derechos de autor que la mayoría de las guías se saltan. Esta guía cubre los tres enfoques, los cuatro grandes portales de EE. UU. y las bases legales. Para los endpoints y campos específicos de cada portal, consulta la documentación de la API de Zillow.
¿Es legal scrapear listados inmobiliarios?
Scrapear datos públicos de listados (precio, dirección, habitaciones/baños, estado) suele ser scraping web público de menor riesgo — en EE. UU., hiQ v. LinkedIn estableció que acceder a datos públicos no viola la CFAA, y hechos como los precios no son objeto de derechos de autor. Pero el sector inmobiliario tiene su propio matiz que conviene tomarse en serio:
- Las fotos y descripciones de los listados tienen derechos de autor, y se protegen. CoStar — dueña de LoopNet, Apartments.com y Homes.com — es el actor más litigioso del sector. Ha demandado a Zillow por decenas de miles de fotos de listados supuestamente copiadas, y ganó contra CREXi después de que esa empresa accediera a datos de CoStar protegidos con contraseña y copiara fotos y listados. La lección: quédate con los campos públicos y factuales; nunca copies fotos de listados ni descripciones de agentes.
- Nunca bypasees un login o un bloqueo de acceso. El caso CREXi giraba en torno a acceder a contenido protegido con contraseña e ignorar avisos de bloqueo — ahí es donde se dispara la responsabilidad, aparte de leer una página pública.
- Las reglas de fair housing aplican a cómo usas los datos (por ejemplo, la segmentación de leads), no solo a cómo los recopilas.
Usa datos públicos y factuales, respeta los términos de cada portal y consulta si el web scraping es legal. Esto no es asesoría legal.
Los cuatro grandes portales de EE. UU. de un vistazo
| Portal | ¿API oficial? | Anti-bot | Mejores datos |
|---|---|---|---|
| Zillow | Solo no oficial (la Bridge API está limitada a partners) | Alto — Imperva (Incapsula) | Zestimate, historial de precios, tasación fiscal |
| Realtor.com | Sin API pública | Alto — Akamai | Listados activos con precisión MLS, open houses |
| Redfin | Parcial — ofrece descargas de datos/CSV | Medio — Cloudflare + límites de tasa | Datos de ventas, Redfin Estimate, HOA, año de construcción |
| Trulia | No (propiedad de Zillow) | Medio-alto — comparte el stack de Imperva de Zillow | Insights de barrio: criminalidad, desplazamiento, ruido |
Ninguno ofrece una API pública abierta de listados, por lo que los equipos scrapean — y por lo que una API estructurada o gestionada suele ser el camino de menor resistencia.
Opción 1: DIY en Python (y por qué se rompe)
Los portales inmobiliarios renderizan con mucho JavaScript y se defienden de forma agresiva, así que recurres a un navegador headless:
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
page = p.chromium.launch().new_page()
page.goto("https://www.zillow.com/austin-tx/")
# then parse the embedded JSON blob, page by map region, and clear the CAPTCHA...
Funciona en la demo y luego se rompe. Zillow corre Imperva (Incapsula) con desafíos de JavaScript, fingerprinting y análisis de comportamiento; Realtor.com añade checks de sensor de Akamai; Redfin añade Cloudflare y limitación de tasa. Un requests.get() ingenuo se bloquea al instante, y hasta un navegador stealth necesita mantenimiento constante a medida que esas defensas se actualizan. (Por qué el fetch, no el parseo, es el verdadero cuello de botella: consulta AI vs web scraping tradicional.)
Opción 2: Herramientas no-code
Los extractores visuales (point-and-click) exportan CSV/JSON y sirven para extracciones puntuales, pero se vuelven caros y frágiles en portales protegidos y no son ideales para pipelines en producto con campos predecibles.
Opción 3: Una API inmobiliaria estructurada
Para workflows repetibles, una API de datos inmobiliarios devuelve JSON normalizado sin necesidad de correr un navegador. El portal que Crawlora soporta hoy es Zillow. Resuelve una ubicación y luego busca:
curl -s "https://api.crawlora.net/api/v1/zillow/search?location=Austin,%20TX" \
-H "x-api-key: $CRAWLORA_API_KEY"
Obtén un listado individual por ZPID en Python:
import requests
prop = requests.get(
"https://api.crawlora.net/api/v1/zillow/property/12345678",
headers={"x-api-key": "YOUR_API_KEY"},
).json()["data"]
print(prop.get("address"), prop.get("price"), prop.get("bedrooms"))
Una respuesta es JSON normalizado que puedes guardar directamente (los campos son ilustrativos — revisa la documentación):
{
"code": 200,
"msg": "OK",
"data": [
{
"zpid": "12345678",
"address": "123 Example St, Austin, TX",
"price": 625000,
"bedrooms": 3,
"bathrooms": 2,
"status": "FOR_SALE"
}
]
}
Qué puedes recopilar
Donde el listado público los expone: ZPID, dirección, precio, habitaciones, baños, superficie habitable, tamaño del lote, tipo de vivienda, estado y broker, además del contexto de búsqueda o ZPID que solicitaste. Resuelve primero las ubicaciones con el endpoint de autocompletado para obtener la forma de request más estable.
Portal por portal: qué hay y qué tan difícil es
- Zillow es el más rico en datos (Zestimate, historial de precios completo, tasación fiscal, escuelas) y el más protegido. Alrededor del 40 % de los datos útiles está en el JSON-LD de la página; el resto vive en un blob incrustado estilo
__NEXT_DATA__que cambia de forma. Este es el portal que Crawlora soporta hoy — consulta los endpoints de Zillow en la documentación. - Redfin es el más amigable: publica datos descargables para resultados de búsqueda y tiene una detección de bots más ligera, así que los precios de venta, HOA, tamaño del lote, año de construcción y el Redfin Estimate son los más accesibles.
- Realtor.com extrae directamente del MLS, lo que lo hace el más preciso para listados activos (números MLS, oficina del listado, open houses) — pero Akamai lo convierte en uno de los más difíciles de recopilar a escala.
- Trulia (propiedad de Zillow) comparte los mismos datos y el mismo stack; su diferenciador son los datos de barrio — criminalidad, tiempos de desplazamiento, ruido y reseñas locales.
- LoopNet / CoStar (inmuebles comerciales) es un caso especial: datos ricos, pero la aplicación legal más agresiva del sector. Trátalo con precaución extra.
Para portales que Crawlora aún no documenta, usarás una configuración de scraping general u otra herramienta — y aplican las mismas bases legales. Cuéntanos qué portales necesitas y priorizaremos la cobertura.
La realidad anti-bot a escala
Correr scraping inmobiliario en producción significa aceptar unas cuantas realidades que las demos se saltan:
- Los proxies residenciales son obligatorios. Las IPs de datacenter se queman en horas; necesitas IPs residenciales de EE. UU., con sesiones persistentes (sticky) para Zillow (que sirve datos distintos según la ubicación).
- Marca tu ritmo. Espacia las requests varios segundos con jitter; sin proxy, en la práctica se topa alrededor de 20-50 páginas de detalle por día y por IP antes de los bloqueos.
- Los bypasses se pudren. Imperva, Akamai, Cloudflare y PerimeterX se actualizan de forma continua, así que las soluciones open source duran semanas, no meses.
- Los listados cambian a diario. Los precios, el estado y las fotos cambian constantemente, así que re-scrapeas según un calendario — lo que multiplica cada uno de los costos anteriores.
Esta carga de anti-bot, proxy y re-scraping es exactamente lo que una API estructurada o gestionada absorbe detrás de una sola key — así dedicas tiempo a los datos, no a las defensas.
Dónde se usa esto
- Búsqueda de deals para inversores — sigue listados, precios e inventario por mercado y puntúa deals.
- Comparables e investigación de mercado — obtén listados comparables para una zona. Consulta inteligencia de mercado inmobiliario.
- Leads y mapeo de territorio — combina el contexto del listado con datos locales para workflows inmobiliarios.
Fuentes
Empieza a recopilar
Pruébalo primero, gratis: ejecuta cualquier URL pública en el Free Web Scraper, o comprueba si un sitio bloquea bots con el Anti-Bot Checker — sin registro.
Prueba el endpoint de búsqueda en el Playground, revisa el esquema en la documentación de la API y consulta la API de datos inmobiliarios. Para una inmersión en un solo portal, consulta cómo scrapear Zillow o, para contrastar sus estimaciones con una segunda fuente, cómo scrapear Redfin; para el lado del alquiler a corto plazo del mercado, cómo scrapear Airbnb; para el contexto de coste de vida detrás de los precios de vivienda de un mercado, cómo scrapear Numbeo; y para la otra gran categoría de reventa que la gente sigue de la misma forma, cómo scrapear anuncios de coches usados. Para el panorama más amplio, consulta inteligencia de mercado inmobiliario y si el web scraping es legal.
Preguntas frecuentes
¿Cuál es la forma más fácil de scrapear listados inmobiliarios?
Llama a una API estructurada que devuelva resultados de búsqueda y detalles de la vivienda como JSON, en lugar de correr un navegador headless contra el HTML del portal. Los endpoints de Zillow de Crawlora devuelven registros de propiedades normalizados (precio, habitaciones, baños, dirección) con una sola API key.
¿Es legal scrapear listados inmobiliarios?
Recopilar datos públicos de listados (precio, dirección, habitaciones/baños, estado) es menos riesgoso, pero los términos de los portales suelen prohibir el acceso automatizado, y las fotos y descripciones pueden tener derechos de autor. Quédate con datos públicos y factuales, respeta las reglas de fair housing y los términos, y no vuelvas a publicar medios. Consulta nuestra guía sobre si el web scraping es legal. Esto no es asesoría legal.
¿Qué sitios inmobiliarios son los más difíciles de scrapear?
Zillow (y Trulia, que comparte su stack) corren Imperva, y Realtor.com corre Akamai, por lo que son los más difíciles a escala; Redfin es más fácil (Cloudflare más límites de tasa) e incluso publica datos descargables. Todos necesitan proxies residenciales y un ritmo cuidadoso — las IPs de datacenter se bloquean en cuestión de horas.
¿Es legal scrapear fotos de listados inmobiliarios?
Trata las fotos y las descripciones de los agentes como protegidas por derechos de autor — no las copies ni las vuelvas a publicar. CoStar (LoopNet, Apartments.com, Homes.com) hace cumplir de forma agresiva los derechos de autor sobre las fotos de listados y ha demandado por imágenes copiadas. Quédate con campos públicos y factuales como precio, dirección y habitaciones/baños, y nunca bypasees un login o un bloqueo de acceso.
¿Qué portales inmobiliarios puede scrapear Crawlora?
Los endpoints inmobiliarios que Crawlora documenta hoy cubren Zillow — search, detalle de propiedad y autocomplete. Para otros portales como Redfin, Realtor.com, Trulia y LoopNet, usarás una configuración general u otra herramienta; dinos qué portales debemos priorizar.
¿Puedo scrapear Zillow específicamente?
Sí — resuelve una ubicación con autocomplete, llama a la búsqueda de Zillow por ubicación y obtén un listado por ZPID. Consulta la guía dedicada a scrapear Zillow para los detalles específicos del portal.