Tony Wang5 min de lecturaCómo scrapear Reddit en 2026 (API y Python)
Tres formas de scrapear posts, comentarios y subreddits de Reddit: Python DIY, no-code o API estructurada, qué devuelve cada una y las bases legales.
La forma más rápida de scrapear Reddit en 2026 es llamar a una API estructurada que devuelve JSON normalizado — posts, comentarios y feeds de subreddits con puntuaciones, autores y timestamps — en lugar de lidiar tú mismo con los rate limits y los muros de login de Reddit. El DIY es posible, pero desde que la Data API oficial de Reddit se volvió de pago y con rate limits estrictos en 2023, el scraping casual se rompe rápido.
Reddit es una de las fuentes más citadas en respuestas de IA, y es justo por eso que los equipos la recopilan para investigación de comunidad, sentimiento y datos de grounding. Un endpoint estructurado te da los hilos como JSON limpio sin gestionar tokens ni cuotas.
¿Es legal scrapear Reddit?
El contenido de Reddit es público, pero los posts y comentarios los escriben personas, así que trátalos como datos personales cuando corresponda:
- Recopila solo posts, comentarios y subreddits públicos — nada de contenido privado o con acceso en cuarentena.
- Los términos de la API oficial de Reddit y sus rate limits existen; revísalos junto con tu legislación local antes de un uso comercial o de entrenamiento de IA.
- Minimiza y protege cualquier dato que identifique usuarios que almacenes (nombres de usuario, etc.).
- No vuelvas a publicar contenido de forma que viole los términos de la plataforma o las expectativas de los usuarios.
Esto no es asesoría legal — consulta ¿Es legal el web scraping en 2026? para el detalle entre datos públicos y personales.
Opción 1: DIY en Python (y por qué ya no funciona)
Durante años pudiste llamar directamente a los endpoints .json sin autenticación de Reddit. Eso dejó de funcionar en mayo de 2026 — Reddit eliminó el acceso .json sin autenticación, y la llamada de abajo ahora devuelve 403 Forbidden:
import requests
resp = requests.get(
"https://www.reddit.com/r/webdev/top.json",
params={"limit": 25},
headers={"User-Agent": "my-app/0.1"},
)
data = resp.json()
# ...then handle 429s, pagination cursors, and comment trees yourself
El dolor recurrente:
- El
.jsonsin autenticación está muerto (2026). La llamada de arriba ahora devuelve 403 — mira por qué Reddit lo bloqueó. El DIY ahora implica la API OAuth autenticada o una sesión de navegador real con login, con obstáculos de fingerprint TLS y reputación de IP encima. - Sobrecarga y costo de autenticación — la vía oficial implica apps y tokens OAuth, y la Data API de Reddit es de pago más allá del uso gratuito no comercial (100 solicitudes/minuto): el acceso comercial cuesta unos $0.24 por cada 1,000 solicitudes, y los contratos empresariales arrancan cerca de $12,000/año.
- Árboles de comentarios — las respuestas anidadas requieren recorrido recursivo y un aplanado cuidadoso.
- Cursores de paginación — los tokens
afterhay que pasarlos por cada llamada.
Opción 2: Herramientas no-code y listas para usar
Las herramientas de navegador pueden capturar un hilo, pero el social listening implica vigilar muchos subreddits y consultas a lo largo del tiempo y guardar el histórico. Eso es un pipeline, y una API lo sirve mejor que una exportación manual.
Opción 3: Una API estructurada de Reddit
La API de Reddit de Crawlora expone endpoints documentados para búsqueda, posts individuales, hilos de comentarios y feeds de subreddits, devolviendo JSON normalizado desde una sola API key.
curl -G "https://api.crawlora.net/api/v1/reddit/search" \
-H "x-api-key: $CRAWLORA_API_KEY" \
--data-urlencode "q=web scraping" \
--data-urlencode "sort=top" \
--data-urlencode "limit=25"
import requests
resp = requests.get(
"https://api.crawlora.net/api/v1/reddit/search",
headers={"x-api-key": "YOUR_API_KEY"},
params={"q": "web scraping", "sort": "top", "limit": 25},
)
for post in resp.json()["data"]["posts"]:
print(post["score"], post["subreddit"], post["title"])
Una respuesta es JSON normalizado (los campos son ilustrativos — confirma el esquema en los docs):
{
"code": 200,
"msg": "OK",
"data": {
"posts": [
{
"id": "abc123",
"subreddit": "webdev",
"title": "Example post title",
"author": "example_user",
"score": 482,
"num_comments": 73,
"created_utc": 1780387665
}
]
}
}
A partir del id de un post, obtén sus comentarios, o sigue una comunidad con el endpoint de subreddit:
post_id = "abc123"
h = {"x-api-key": "YOUR_API_KEY"}
comments = requests.get(f"https://api.crawlora.net/api/v1/reddit/comments/{post_id}",
headers=h, params={"limit": 100}).json()
hot = requests.get("https://api.crawlora.net/api/v1/reddit/subreddit/webdev/posts",
headers=h, params={"sort": "hot"}).json()["data"]["posts"]
El endpoint de comentarios devuelve comentarios públicos planos (sin árbol de respuestas recursivo que recorrer), y cada lista pagina con un token after. Son los mismos endpoints detrás del caso de estudio de r/SaaS mencionado en nuestra estrategia de contenido y SEO — guarda una fila por post o comentario y vuelve a ejecutarlo con una programación para social listening continuo.
Qué puedes recopilar
- Resultados de búsqueda en todo Reddit: título, subreddit, autor, puntuación y cantidad de comentarios
- Detalle completo del post y comentarios públicos planos por
id - Feeds de subreddits ordenados por hot, new, top y rising
- Paginación vía
after, más filtrostimeysort
Limitaciones y desafíos comunes
- La API oficial es la vía cara. El uso gratuito es solo no comercial y está limitado a 100 solicitudes/minuto; el acceso comercial cuesta unos $0.24 por cada 1,000 solicitudes, con contratos empresariales que arrancan cerca de $12,000/año. Los endpoints
.jsonpúblicos y gratuitos a los que recurrían los equipos desaparecieron desde mayo de 2026, dejando la API de pago o un scraper gestionado. - Los comentarios vuelven planos. Los datos públicos de comentarios son una lista plana, no un árbol de respuestas anidado — más simple de almacenar, pero reconstruye el anidamiento a partir de los parent ids tú mismo si lo necesitas.
- Paginación. Las listas paginan con un token
after; hay que pasarlo por cada llamada en lugar de esperar obtenerlo todo de una vez. - Los nombres de usuario son datos personales. Trata a los autores y el texto de los comentarios como potencialmente personales bajo el RGPD/CCPA — minimiza lo que almacenas y ten una base legal, especialmente para uso de entrenamiento de IA.
- Rate limits y bloqueos para el DIY. Las solicitudes sin autenticación reciben 429 rápidamente; una API estructurada gestiona el ritmo, los proxies y los reintentos detrás de una sola key.
Fuentes
Dónde encaja esto
Pruébalo primero, gratis: pasa cualquier URL pública por el Free Web Scraper, o comprueba si un sitio bloquea bots con el Anti-Bot Checker — sin registro.
Los datos de Reddit alimentan la investigación de comunidad, el sentimiento de marca y producto, y los datos de grounding para IA. Alimenta hilos a un pipeline de retrieval o a un agente con la integración MCP y el flujo de datos web para agentes de IA, o rastrea menciones de marca junto con el monitoreo de reseñas y reputación — y para reseñas de negocio estructuradas que colocar junto al chatter no estructurado de Reddit, mira cómo scrapear reseñas de Trustpilot. Cuando el subreddit es de finanzas, combina ese chatter con los números subyacentes — cómo scrapear Yahoo Finance cubre cotizaciones, histórico y fechas de resultados, y cómo scrapear CoinGecko hace lo mismo para los tickers cripto sobre los que discuten esos hilos. Para una comparación completa frente a otras APIs de datos de Reddit, mira las mejores APIs de scraper de Reddit en 2026. Para el resto del stack social, mira cómo scrapear YouTube, cómo scrapear TikTok, cómo scrapear LinkedIn y cómo scrapear Twitter/X, además de cómo scrapear Bluesky y cómo scrapear Telegram para otros feeds abiertos y centrados en la conversación; para el kit de herramientas más amplio, mira cómo elegir una API de web scraping.
Empieza probando el endpoint en el Playground, leyendo el esquema de request y response en los docs de la API, y revisando los costos en créditos en la página de precios.
Parte de nuestra serie de guías de cómo scrapear — cada plataforma que cubrimos, en un solo índice.
Preguntas frecuentes
¿Puedo scrapear Reddit sin que me bloqueen?
Crawlora gestiona el rate limiting, los proxies y los reintentos detrás de la API, así que evitas los 429 y la gestión de tokens al acceder directamente a Reddit, y obtienes JSON normalizado.
¿Reddit sigue teniendo una API gratuita?
La Data API oficial de Reddit es gratuita solo para uso no comercial y está limitada a 100 solicitudes/minuto; se volvió de pago y con rate limits estrictos en 2023. Los endpoints de Reddit de Crawlora devuelven posts públicos, comentarios y feeds de subreddits como JSON normalizado desde una sola API key de Crawlora.
¿Cuánto cuesta la API de Reddit?
Gratis para uso no comercial (100 solicitudes/minuto vía OAuth/PRAW). El acceso comercial cuesta unos $0.24 por cada 1,000 solicitudes, y los contratos empresariales arrancan cerca de $12,000/año — por eso muchos equipos ahora usan una API de scraper gestionada en su lugar: los endpoints .json públicos y gratuitos se cerraron en mayo de 2026.
¿Puedo obtener hilos de comentarios completos de Reddit?
El endpoint de comentarios de Crawlora devuelve comentarios públicos planos para un post (acepta sort y depth por compatibilidad, pero los datos públicos de comentarios son planos). Es más simple de almacenar; reconstruye el anidamiento a partir de los parent ids tú mismo si necesitas el árbol de respuestas.
¿Puedo scrapear datos privados o personales?
No. Solo están dentro del alcance los posts, comentarios y subreddits públicos. Trata los nombres de usuario y el contenido como datos personales y revisa los términos de Reddit y tu legislación local antes de un uso comercial o de entrenamiento de IA.
¿Qué puedo recopilar de Reddit?
Resultados de búsqueda, detalle completo de posts, comentarios públicos planos y feeds de subreddits, con paginación por sort, time, limit y cursor after.
¿Puedo usar datos de Reddit para IA o RAG?
Puedes alimentar hilos públicos a pipelines de retrieval y agentes, por ejemplo mediante la integración MCP, sujeto a los términos de Reddit y a la legislación aplicable a tu caso de uso.