Tony Wang6 min de lecturaCómo scrapear ImportYeti en 2026 (API y Python)
Scrapea ImportYeti en 2026: busca proveedores por nombre y saca informes de envíos aduaneros de EE. UU. en JSON — DIY, no-code o API.
La forma más rápida de scrapear ImportYeti en 2026 es llamar a una API estructurada que devuelve JSON normalizado para la búsqueda de company y supplier además de informes completos de empresa — en lugar de parsear tú mismo las páginas renderizadas de ImportYeti. ImportYeti convierte los registros de US Customs Bill of Lading en un directorio buscable de proveedores y fabricantes que envían mercancía a EE. UU., pero no tiene una API pública self-serve y sus Terms of Service son explícitos respecto al acceso automatizado. Esta guía cubre qué hay realmente disponible, dónde falla el DIY y los conceptos legales básicos.
¿Por qué scrapear ImportYeti?
Los datos de búsqueda e informes de empresa de ImportYeti están pensados para workflows de cadena de suministro y sourcing:
- Descubrimiento de proveedores — buscar una categoría de producto o el nombre de una empresa para encontrar qué fábricas y fabricantes están enviando ese tipo de producto a EE. UU.
- Investigación de proveedores de la competencia — consultar el perfil de empresa de una marca conocida o competidor para ver quiénes son sus proveedores y cómo evoluciona su volumen de importación.
- Due diligence de sourcing — obtener las métricas destacadas de volumen de envíos de un posible proveedor antes de contactarlo, como comprobación rápida de escala y actividad.
- Monitoreo de proveedores y cadena de suministro — volver a ejecutar un informe de empresa con periodicidad para hacer seguimiento de si el volumen de envíos ante la aduana de EE. UU. de un proveedor crece, se mantiene estable o cae.
¿Es legal scrapear ImportYeti?
Opción 1: DIY en Python (y por qué se rompe)
Un scraper DIY solicita las páginas de búsqueda y perfil de empresa de ImportYeti y parsea el HTML renderizado:
import requests
from bs4 import BeautifulSoup
resp = requests.get(
"https://www.importyeti.com/company/some-company-slug",
headers={"User-Agent": "Mozilla/5.0 (compatible; research-bot/1.0)"},
)
soup = BeautifulSoup(resp.text, "html.parser")
# Company identity fields and shipment-volume metrics render as
# client-side data, not consistently selectable static markup
Funciona en la demo y luego se rompe:
- Los Terms of Service nombran directamente la recuperación automatizada. Los términos de ImportYeti prohíben explícitamente robots, spiders y "cualquier... dispositivo o proceso manual o automático" usado para recuperar, indexar o hacer data-mining del sitio — es una restricción real y citada textualmente, no una cláusula genérica de relleno.
- No hay API pública de búsqueda o de empresa contra la que construir. No existe un programa de desarrolladores self-serve — cada campo que quieras hay que scrapearlo de una página renderizada, sin garantía de esquema estable ante un rediseño.
- Dos tipos de resultado distintos en una sola búsqueda. La búsqueda de ImportYeti mezcla companies y suppliers en los mismos resultados, y un scraper ingenuo tiene que distinguir correctamente entre ambos antes de decidir qué página pedir a continuación.
- La reventa queda descartada por los propios términos. Incluso un scraper que funcione no resuelve la restricción mayor — el uso autorizado de ImportYeti es no comercial, así que un dataset scrapeado tampoco puede venderse ni redistribuirse bajo esos términos.
Opción 2: herramientas no-code
Existen actores de scraping de marketplace para ImportYeti y pueden llevar una página de empresa puntual a una hoja de cálculo, pero heredan la misma exposición a los Terms of Service que el DIY — "cualquier... dispositivo o proceso manual o automático" no se limita a código escrito a mano — y no te dan un esquema estable y versionado para un pipeline de sourcing repetible.
Opción 3: una API estructurada de ImportYeti
Para un workflow repetible, la API de ImportYeti de Crawlora devuelve JSON normalizado para la búsqueda de company/supplier y los informes completos de empresa — sin parsear páginas, sin credenciales, y sin que se requiera cuenta o API key de ImportYeti por parte de quien llama. Busca por nombre de empresa o proveedor:
curl "https://api.crawlora.net/api/v1/importyeti/search?query=stanley" \
-H "x-api-key: $CRAWLORA_API_KEY"
{
"code": 200,
"msg": "OK",
"data": {
"results": [
{
"kind": "company",
"slug": "stanley-black-decker-inc",
"name": "Stanley Black & Decker, Inc.",
"country": "United States",
"address": "1000 Stanley Drive, New Britain, CT"
},
{
"kind": "supplier",
"slug": "stanley-industrial-and-automotive-llc",
"name": "Stanley Industrial And Automotive LLC",
"country": "United States",
"address": ""
}
]
}
}
Luego pasa un slug de empresa de los resultados de búsqueda al endpoint de informe de empresa en Python:
import requests
h = {"x-api-key": "YOUR_API_KEY"}
base = "https://api.crawlora.net/api/v1/importyeti"
hits = requests.get(f"{base}/search", headers=h, params={"query": "stanley"}).json()["data"]["results"]
slug = hits[0]["slug"]
report = requests.get(f"{base}/company", headers=h, params={"slug": slug}).json()["data"]
Un informe de empresa es JSON normalizado — campos de identidad más métricas destacadas de volumen de envíos ante la aduana de EE. UU. (revisa los docs para el conjunto real de campos):
{
"code": 200,
"msg": "OK",
"data": {
"slug": "stanley-black-decker-inc",
"name": "Stanley Black & Decker, Inc.",
"address": "1000 Stanley Drive, New Britain, CT",
"phone": "1-8**-***-****",
"website": "stanleyblackanddecker.com",
"shipment_count": 4218,
"supplier_count": 187,
"first_shipment_date": "2015-01-06",
"last_shipment_date": "2026-08-09"
}
}
Guarda una fila por empresa en cada pull, indexada por slug, y vuelve a ejecutarlo con periodicidad para hacer seguimiento de las tendencias de shipment_count y supplier_count a lo largo del tiempo.
Qué puedes recopilar
Resultados de búsqueda (kind — company o supplier —, slug, name, country y address) e informes completos de empresa (campos de identidad — name, address, teléfono enmascarado, website — más métricas destacadas de volumen de envíos ante la aduana de EE. UU., como shipment count, supplier count y fechas de primer/último envío). Datos públicos tal como ImportYeti ya los expone — no una forma de reconstruir registros en bruto y sin agregar de Bill of Lading ni de eludir los niveles de suscripción de pago del propio ImportYeti para el detalle a nivel de envío.
Limitaciones y desafíos comunes
- La búsqueda devuelve companies y suppliers juntos. Filtra por
kindantes de decidir qué hacer a continuación — un slug de company y un slug de supplier no son inputs intercambiables en otras partes de un pipeline. - Métricas destacadas, no registros de envío en bruto. Es agregación a nivel de empresa (shipment counts, supplier counts, rangos de fechas) — no una exportación línea por línea de cada entrada de Bill of Lading, que es donde profundizan los propios niveles de pago de ImportYeti.
- Los números de teléfono vuelven enmascarados. Campos de contacto como el teléfono están parcialmente redactados en el informe público, igual que lo muestra el propio ImportYeti sin cuenta de pago.
- Restricción de reventa no comercial bajo los términos de ImportYeti. Incluso recopilados de forma legítima, los propios términos del sitio limitan el uso autorizado a fines no comerciales y prohíben vender información o datos a los que se acceda a través del sitio — planifica cualquier uso comercial en consecuencia.
- Sin exportación masiva. No hay un feed oficial del directorio completo de empresas de ImportYeti — construye cobertura iterando consultas de búsqueda por categoría de producto, palabra clave o nombres conocidos de empresas/proveedores.
Dónde se usa esto
- Pipelines de sourcing de proveedores — buscar por categoría de producto y luego obtener informes de empresa de los mejores candidatos antes del contacto.
- Investigación de cadena de suministro de la competencia — hacer seguimiento de los proveedores conocidos de un competidor y su tendencia de volumen de envíos a lo largo del tiempo.
- Monitoreo de riesgo de proveedores — volver a ejecutar un informe de empresa con periodicidad para señalar un proveedor cuyo volumen de envíos caiga bruscamente.
Fuentes
Empieza a recopilar
Pruébalo primero, gratis: pasa cualquier URL pública por el Free Web Scraper, o comprueba si un sitio bloquea bots con el Anti-Bot Checker — sin registro.
Prueba los endpoints de búsqueda e informe de empresa en el Playground, revisa el esquema en los API docs, y consulta los pricing. Para el mismo patrón de inteligencia de empresa agregada en otro mercado, ver how to scrape PitchBook; para otra fuente de datos basada en registros públicos, ver how to scrape SEC EDGAR; y para el lado de las personas en la investigación de proveedores y vendors, ver how to scrape LinkedIn. Ver también how to choose a web scraping API y is web scraping legal.
Preguntas frecuentes
¿Cómo busco empresas de ImportYeti con una API?
Envía el nombre de una empresa o proveedor al endpoint /importyeti/search de Crawlora y obtén resultados normalizados — kind, slug, país y dirección — como JSON estructurado.
¿La API de ImportYeti requiere una cuenta o API key de ImportYeti?
No se requiere ninguna cuenta ni API key de ImportYeti por parte de quien llama — solo tu API key de Crawlora.
¿Qué incluye el informe de empresa?
Campos de identidad (nombre, dirección, teléfono enmascarado, sitio web) más métricas destacadas de volumen de envíos ante la aduana de EE. UU. de esa empresa.