Tony Wang7 min de lecturaCómo scrapear PitchBook en 2026 (API y Python)
Scrapea perfiles de empresas, funds e inversores de PitchBook en 2026 — DIY, no-code o API — y qué es público vs. solo terminal.
La forma más rápida de scrapear PitchBook en 2026 es llamar a una API estructurada que devuelve JSON normalizado — resúmenes de perfil de company, fund, investor, advisor y limited partner — en lugar de parsear tú mismo las páginas renderizadas de PitchBook. PitchBook es el terminal de datos por defecto para la investigación de mercados privados en VC, PE y M&A, pero no tiene API self-serve y sus propios términos están entre los más estrictos de esta serie. Esta guía cubre qué es realmente público, qué no lo es, y las tres formas de recopilarlo.
¿Por qué scrapear datos de perfil de PitchBook?
Las páginas de perfil públicas de PitchBook exponen una porción de contexto de mercados privados que aparece en varios workflows:
- Investigación de startups y empresas — llevar el año de fundación, estado, número de empleados, industria y número de inversores de una empresa a un documento de investigación o a un registro de CRM.
- Descubrimiento de inversores — consultar el tipo, estado y número de inversiones/portfolio/exits de una firma de VC o inversor para calificar un objetivo de fundraising o partnership.
- Seguimiento de funds y LPs — comprobar la estrategia, estado, tamaño, vintage y manager de un fondo, o el tipo de institución y ubicación de un limited partner.
- Investigación de M&A y advisory — confirmar la especialidad de un proveedor de servicios y los deals en los que aparece acreditado.
- Herramientas de market-intelligence y deal-sourcing — enriquecer una base de datos interna de empresas o inversores con los identificadores y descripciones públicos de PitchBook, como una señal más entre varias.
¿Es legal scrapear PitchBook?
Opción 1: DIY en Python (y por qué se rompe)
Un scraper DIY solicita una URL de perfil de PitchBook y parsea la página renderizada:
import requests
from bs4 import BeautifulSoup
resp = requests.get(
"https://pitchbook.com/profiles/company/752821-12",
headers={"User-Agent": "Mozilla/5.0 (compatible; research-bot/1.0)"},
)
soup = BeautifulSoup(resp.text, "html.parser")
# Overview, description, and contact fields render as labeled key/value
# blocks; funding history, cap table, and full investor list render as
# gated "Request a free trial" / "request access" panels with no data
Funciona en la demo y luego se rompe:
- Los ToS son explícitos y cuantifican la penalización. La Sección 4.3 nombra directamente scrapers, robots, bots, spiders y herramientas de data-mining, y el remedio indicado — borrar los datos y pagar el 150% del precio de direct-data — lo convierte en un coste real, no en un riesgo solo teórico.
- La mayor parte de la página está bloqueada, no scrapeada. El historial de funding/valoración, la cap table completa, la lista completa de inversores y el historial de deals se renderizan como avisos de «Request a free trial» o «request access» sin valores subyacentes — no hay nada que parsear ahí, incluso antes de llegar al problema de los ToS.
- Cinco tipos de perfil distintos, cinco formas de URL. Companies, funds, investors, advisors y limited partners viven cada uno bajo su propia ruta
/profiles/{kind}/{id}, con un layout de tabla ligeramente distinto (una página de investor tiene «Co-Investors», una página de company tiene «Investors», una página de fund tiene «Limited Partners»). - Sin vía de descubrimiento. No hay autocompletado ni búsqueda pública que se suponga que debas crawlear — ya necesitas conocer el id o la URL del perfil, y las propias páginas de búsqueda de PitchBook están excluidas en
robots.txt.
Opción 2: herramientas no-code
Existen actores de scraping de marketplace para extracciones puntuales de perfiles de PitchBook, y pueden llevar los campos teaser de una página a una hoja de cálculo. No aguantan nada recurrente — sin scheduling, sin un esquema consistente entre los cinco tipos de perfil, y con la misma exposición a los Terms of Use que el DIY, ya que la Sección 4.3 nombra «any other device, program, tool, algorithm, process or methodology», no solo código propio.
Opción 3: una API estructurada de PitchBook
Para un workflow repetible y con permisos bien delimitados, una API de scraping de PitchBook devuelve JSON normalizado para los cinco tipos de perfil — sin parsear páginas, sin adivinar paneles bloqueados. Obtén un perfil de company por id o URL de origen:
curl "https://api.crawlora.net/api/v1/pitchbook/company?id=752821-12" \
-H "x-api-key: $CRAWLORA_API_KEY"
{
"code": 200,
"msg": "OK",
"data": {
"kind": "company",
"id": "752821-12",
"name": "Thinking Machines Lab",
"description": "Developer of artificial intelligence systems designed to support the research and development of AI technologies.",
"overview": {
"Year Founded": "2024",
"Status": "Private",
"Employees": "130",
"Latest Deal Type": "Early Stage VC",
"Investors": "23"
},
"contact": {
"Website": "http://www.thinkingmachines.ai",
"Ownership Status": "Privately Held (backing)",
"Financing Status": "Venture Capital-Backed",
"Primary Industry": "Business/Productivity Software",
"Corporate Office": "95 3rd Street, 2nd Floor, San Francisco, CA 94103, United States"
},
"tables": [
{
"name": "Investors",
"total": 23,
"columns": ["Investor Name", "Investor Type", "Holding", "Investor Since", "Participating Rounds"],
"rows": [["Accel", "Venture Capital", "Minority", "", ""]]
}
],
"faqs": [
{ "question": "When was Thinking Machines Lab founded?", "answer": "Thinking Machines Lab was founded in 2024." }
],
"source_url": "https://pitchbook.com/profiles/company/752821-12",
"fetched_at": "2026-07-08T20:00:00Z"
}
}
Los otros cuatro tipos — advisor, fund, investor y limited partner — comparten exactamente el mismo envelope, con kind y las etiquetas de overview/contact cambiando según el tipo:
import requests
h = {"x-api-key": "YOUR_API_KEY"}
base = "https://api.crawlora.net/api/v1/pitchbook"
company = requests.get(f"{base}/company", headers=h, params={"id": "752821-12"}).json()["data"]
investor = requests.get(f"{base}/investor", headers=h, params={"id": "294471-37"}).json()["data"]
fund = requests.get(f"{base}/fund", headers=h, params={"url": "https://pitchbook.com/profiles/fund/19719-91F"}).json()["data"]
{
"code": 200,
"msg": "OK",
"data": {
"kind": "investor",
"id": "294471-37",
"name": "Better Capital (California)",
"description": "Founded in 2006, Better Capital is a venture capital firm based in Santa Clara, California.",
"overview": {
"Investor Type": "Venture Capital",
"Status": "Active",
"Investments": "339",
"Portfolio": "218",
"Exits": "49"
},
"contact": {
"Website": "http://www.bettercapital.vc",
"Investor Status": "Actively Seeking New Investments",
"Corporate Office": "1600 Duane Avenue, Santa Clara, CA 95148, United States"
},
"tables": [
{
"name": "Co-Investors",
"total": 843,
"columns": ["Name", "With", "Exits", "Lead Partner", "Series", "Industry"],
"rows": [["Astir Ventures", "33", "", "", "", ""]]
}
],
"source_url": "https://pitchbook.com/profiles/investor/294471-37",
"fetched_at": "2026-07-08T20:00:00Z"
}
}
Los perfiles de advisor, fund y limited partner funcionan igual — cambia la ruta (/pitchbook/advisor, /pitchbook/fund, /pitchbook/limited-partner) y pasa id o url. Guarda una fila por perfil y vuelve a ejecutarlo con periodicidad para seguir cambios en el número de empleados, número de inversores o deal credits a lo largo del tiempo.
Qué puedes recopilar
Por perfil (company, fund, investor, advisor o limited partner): el kind y el id del perfil, name, una description en texto, un bloque overview con campos de resumen específicos del tipo (año de fundación, estado, número de empleados, número de inversores/inversiones/portfolio/exits, tamaño y vintage del fondo, o número de profesionales, según el tipo), un bloque contact (website, estado de ownership/financing, industria principal, oficina corporativa), un array tables con la tabla de relación de ejemplo que ese tipo de perfil expone públicamente (Investors, Co-Investors o Limited Partners — con un recuento total pero solo un puñado de rows visibles), un array corto de faqs, además de source_url y fetched_at. Solo datos teaser públicos.
Limitaciones y desafíos comunes
- Profundidad teaser, no profundidad de terminal. Esto refleja exactamente lo que ve un visitante sin sesión iniciada en una página de perfil pública de PitchBook — unos pocos campos de overview y contacto, una descripción y un puñado de filas de tabla de ejemplo. El historial completo de funding y valoración, las cap tables completas, la lista entera de inversores o LPs, y el detalle deal por deal quedan detrás del propio login de PitchBook y requieren su plataforma de pago o un contrato licenciado de Direct Data / API para verse en su totalidad.
- Sin endpoint de búsqueda o descubrimiento. Aquí no hay ningún endpoint de autocompletado o búsqueda de PitchBook, y las propias rutas
/searchy/profiles/searchde PitchBook están excluidas del crawling en surobots.txtde todos modos — los ids y URLs de perfil normalmente vienen de una búsqueda web, un comunicado de prensa u otro dataset que ya tengas, no de crawlear el propio PitchBook. - Cinco tipos de perfil, cinco espacios de ids. Un id de company como
752821-12y un id de investor como294471-37no son intercambiables entre endpoints — solicita el tipo que corresponde al id o URL que tienes. - Bloqueado por los ToS con una cláusula de aplicación real. La Sección 4.3 de PitchBook prohíbe expresamente scrapers y bots, y fija una penalización del 150% del precio más borrado obligatorio de datos por incumplirla — limita cualquier proyecto a un uso de referencia genuinamente público, y pasa por el propio equipo de Direct Data de PitchBook para cualquier cosa a escala comercial.
- Solo datos públicos. Esto recopila lo que PitchBook ya muestra a un visitante sin sesión iniciada — nunca una forma de reconstruir la base de datos subyacente de deals, valoraciones o cap tables de PitchBook, que es el producto que PitchBook mismo vende como suscripción de plataforma enterprise.
Dónde se usa esto
- Herramientas de deal-sourcing y prospecting — enriquecer una lista objetivo de empresas o inversores con los identificadores públicos de PitchBook, como una señal más junto a otras fuentes.
- Investigación competitiva y de mercado — hacer seguimiento del estado público, la clasificación de industria y el número de inversores de una empresa a lo largo del tiempo.
- Mapeo de relaciones LP/GP — cruzar limited partners, fund managers y patrones de coinversión a partir de datos de perfil públicos.
- Enriquecimiento de CRM y documentos de investigación — adjuntar un enlace verificado a un perfil de PitchBook y sus campos de resumen a un registro interno de empresa o inversor.
Fuentes
Empieza a recopilar
Pruébalo primero, gratis: pasa cualquier URL pública por el Free Web Scraper, o comprueba si un sitio bloquea bots con el Anti-Bot Checker — sin registro.
Prueba los endpoints de company, fund, investor, advisor y limited-partner en el Playground, revisa el esquema en los API docs, y consulta los pricing. Los datos de funding te dicen quién respalda a una empresa; los datos de lanzamiento y tracción de Product Hunt te dicen si el mercado realmente se dio cuenta — combina ambos para un pipeline de investigación de startups que cubra capital y demanda. Del lado de las personas, how to scrape GitHub cubre la señal de actividad de desarrolladores que a menudo precede a una ronda de funding. Para el lado bootstrapped del mismo mercado — empresas que se saltaron por completo la ronda de VC — how to scrape TrustMRR cubre revenue y MRR verificados para SaaS indie. Ver el caso de uso más amplio de alternative data para ver cómo señales de mercados privados como esta encajan en un pipeline de investigación.
Parte de nuestra serie de guías how-to-scrape — cada plataforma que cubrimos, en un solo índice.
Preguntas frecuentes
¿PitchBook tiene una API pública?
No una self-serve. La propia API de PitchBook es un contrato aparte, vendido a través del equipo de Direct Data, no un producto de registro y clave.
¿Es legal scrapear PitchBook?
Los Terms of Use de PitchBook (Sección 4.3) prohíben expresamente que scrapers, robots, bots, spiders y herramientas de data-mining accedan o copien sistemáticamente el Site o su Content, con una penalización indicada del 150% del precio de direct-data más borrado obligatorio. Esta guía solo cubre los campos teaser públicos que ya ve un visitante sin sesión iniciada; consigue tu propia licencia de PitchBook para cualquier uso a gran escala. No es asesoría legal.
¿Qué cubre el terminal de pago de PitchBook que estos datos públicos no ofrecen?
La plataforma de pago (y su contrato licenciado de Direct Data / API) desbloquea el historial completo de funding y valoración, cap tables completas, la lista entera de inversores o LPs, y el detalle deal por deal. La vista de perfil pública — y esta API — solo devuelven el overview, la description, los campos de contacto y un puñado de filas de tabla de ejemplo que PitchBook muestra sin login.
¿Cuánto cuesta una suscripción a PitchBook?
PitchBook no publica precios; los informes de compradores suelen citar aproximadamente entre 12.000 y 70.000+ $/año según los seats y módulos de datos, vendidos mediante un acuerdo comercial en lugar de un checkout self-serve.
¿Puedo obtener la lista completa de inversores de una empresa con esta API?
No — el campo tables devuelve una muestra de filas (a la par de lo que muestra la página pública) más un recuento total, no la lista completa. La tabla completa de inversores, LPs o deals está detrás del propio login de PitchBook.
¿Existe un endpoint de búsqueda de empresas de PitchBook?
No en esta API, y el propio robots.txt de PitchBook excluye /search y /profiles/search del crawling. Debes pasar un id o URL de perfil conocido en lugar de descubrirlo a través de la API.
¿Qué tipos de perfil cubre la API de PitchBook?
Cinco: company, fund, investor, advisor y limited partner. Cada uno devuelve el mismo envelope JSON con campos de overview y contacto específicos de su tipo.