Tony Wang7 min de lecturaPor qué Reddit bloqueó el JSON sin autenticar en 2026 (y cómo seguir obteniendo datos de Reddit)
Reddit eliminó los endpoints .json sin autenticar en 2026 (ahora dan 403). Por qué —licencias de AI y bots— y cómo obtener datos de Reddit ahora.
Durante años, la forma más sencilla de sacar datos estructurados de Reddit fue un truco que todo el mundo conocía: añadir .json a cualquier URL de Reddit y recibir JSON limpio de vuelta — sin API key, sin OAuth, sin cuenta. Eso alimentaba en silencio a la mayoría de los scrapers de Reddit de código abierto, scripts de investigación, bots y pipelines de datos.
Esa puerta ahora está cerrada. El 28 de mayo de 2026, Reddit publicó Protecting communities from scrapers and platform abuse en r/modnews, anunciando que cerraría el acceso .json sin autenticar. En cuestión de días, las solicitudes empezaron a devolver 403 Forbidden — sin ningún período de transición. Si tu scraper «sigue corriendo» pero no devuelve nada, esta es la razón.
Este post explica por qué lo hizo Reddit — la respuesta tiene que ver, sobre todo, con AI y dinero — y las formas legítimas de seguir consiguiendo datos de Reddit en 2026.
Qué se rompió exactamente
En palabras de Reddit: "Deprecating unauthenticated JSON access: We'll also be shutting down unauthenticated .json endpoints. These endpoints can be used to scrape Reddit without accountability. Logged-in and authenticated access won't be impacted."
Es decir:
- Las solicitudes anónimas a
.jsonahora devuelven 403.https://www.reddit.com/r/<sub>/top.jsony similares ya no devuelven datos sin autenticación. Vuelto a probar el 11 de julio de 2026: sigue dando403 Forbidden, incluso con un User-Agent de navegador. - Falla en silencio en muchas herramientas. Muchos scrapers reciben un 403 (o una respuesta vacía/de redirección) pero parecen «tener éxito», así que los pipelines se apagan sin avisar en lugar de fallar de forma ruidosa.
- El acceso autenticado sigue funcionando. Las sesiones con sesión iniciada y la API oficial de OAuth no se ven afectadas — ese es justamente el objetivo del cambio.
- RSS es lo siguiente. En el mismo post, Reddit llamó a RSS «another common surface for scraping», así que el acceso basado en feeds también está bajo aviso.
Por qué lo hizo Reddit
El cambio técnico es pequeño. La motivación detrás de él es la historia importante — y sí, tiene mucho que ver con los chatbots de AI y el tráfico de bots.
Los datos de Reddit se convirtieron en una mina de oro para la AI — y en un producto
Reddit son dos décadas de preguntas, respuestas y opiniones humanas reales — exactamente el tipo de texto que hace útiles a los grandes modelos de lenguaje, y una de las fuentes más citadas en las respuestas de AI. En cuanto eso se hizo evidente, Reddit convirtió su archivo en un producto licenciado:
- Un acuerdo de licencia con Google por ~$60M/año (febrero de 2024) para entrenar a Gemini con datos de Reddit.
- Un acuerdo de licencia con OpenAI (mayo de 2024) para ChatGPT.
- ~$130M en ingresos por licencia de datos en 2024 — más o menos un 10% de los ingresos totales de Reddit.
Cuando los datos son el producto, el endpoint gratuito de añadir .json es una fuga: dejaba que cualquiera — en especial las empresas de AI — se llevara los mismos datos gratis, socavando los acuerdos de pago.
Los bots de AI se llevaban los datos gratis — «sin rendición de cuentas»
Esta es la parte en la que la intuición de la mayoría acierta. La explosión de crawlers de entrenamiento de AI y de agentes de «grounding» en vivo (asistentes que consultan hilos de Reddit en el momento de responder) generó un tráfico automatizado enorme contra justo los endpoints que no requerían identidad. Reddit lo nombra directamente en su planteamiento: "large-scale scraping, spam networks, agentic account creation, and automated abuse." La ruta .json sin autenticar era la puerta trasera anónima para todo esto — datos tomados sin ninguna key con la que limitar la tasa, facturar o banear.
Así que Reddit empezó a hacer cumplir las reglas — en los tribunales
Matar .json es la mitad técnica de una campaña más amplia:
- Reddit demandó a Anthropic (junio de 2025), alegando que sus bots rastrearon Reddit más de 100.000 veces y se saltaron el
robots.txtdespués de rechazar la licencia. - Reddit luego demandó a Perplexity y a tres empresas de scraping — SerpApi, Oxylabs y AWM Proxy (octubre de 2025).
- Reddit bloqueó la Wayback Machine del Internet Archive (agosto de 2025) por preocupaciones sobre el scraping para AI.
Cortar el acceso anónimo a .json es la forma de hacer cumplir «lo licencias o no lo tomas» a nivel de protocolo.
Es parte del «cierre de la web» más amplio
Reddit es el ejemplo más visible de un cambio más amplio: a medida que la AI hizo que los datos web fueran comercialmente valiosos, la web abierta, anónima, de añadir .json, se está cerrando. Los sitios están restringiendo y monetizando los datos, Cloudflare ahora bloquea a los crawlers de AI por defecto para muchos clientes, y el «pay-per-crawl» se está volviendo real. La era del acceso casual y anónimo a datos públicos está llegando a su fin.
Por qué tu scraper ahora recibe 403 (no son tus credenciales)
Los equipos que se topan con esto suponen que es un bug de autenticación o de rate limit. Normalmente no lo es. La aplicación de reglas de Reddit en 2026 también se apoya en:
- Fingerprinting de TLS — los clientes genéricos (
requests,wget,curlpor defecto) se identifican por su handshake TLS y se bloquean, incluso con headers perfectos. - Reputación de IP — las IPs de datacenter y de la nube (GitHub Actions, Vercel, hosts habituales) están muy marcadas; la misma solicitud a menudo funciona desde un navegador residencial y da 403 desde un servidor.
- Sin fallback anónimo — la ruta
.jsonque antes absorbía todo esto ya no existe.
Por eso «añade un User-Agent» o «baja la tasa» ya no lo arregla — el bloqueo está en la capa de política de acceso y de fingerprint, no en la tasa de solicitudes.
Cómo conseguir datos de Reddit en 2026 (opciones legítimas)
La ruta anónima gratuita se acabó, pero los datos públicos de Reddit siguen siendo accesibles por vías autorizadas. Ordenadas:
1. La API oficial de datos de Reddit / Devvit
Reddit dirige a los desarrolladores hacia su Data API autenticada (OAuth) y la plataforma de desarrollo Devvit — la vía autorizada:
- Gratis para uso no comercial, con un límite de ~100 requests/minute.
- El acceso comercial cuesta alrededor de $0.24 por 1.000 requests; los acuerdos empresariales empiezan cerca de los $12,000/año.
Es la mejor opción cuando puedes registrar una app, hacer el proceso de OAuth y tu uso encaja con los términos de Reddit.
2. Acceso autenticado / basado en sesión
Una sesión de navegador con sesión iniciada (cookies, un navegador real vía Playwright) sigue funcionando, porque el acceso autenticado no se ve afectado. Es viable para trabajos pequeños y cuidadosos — pero es frágil (las sesiones caducan, los fingerprints se marcan) y tú te haces cargo de todo el mantenimiento y del riesgo de los términos de servicio.
3. Una API gestionada de Reddit (Crawlora)
Si quieres datos estructurados de Reddit sin mantener auth, proxies y fingerprints — ni reescribir tu scraper cada vez que Reddit cambia las reglas — una API gestionada hace eso por ti. La API de Reddit de Crawlora devuelve JSON normalizado para búsquedas, posts, hilos de comentarios y feeds de subreddits desde una sola key, y mantiene la vía de acceso funcionando a medida que Reddit la endurece:
curl -G "https://api.crawlora.net/api/v1/reddit/subreddit/webdev/posts" \
-H "x-api-key: $CRAWLORA_API_KEY" \
--data-urlencode "sort=hot" \
--data-urlencode "limit=25"
import requests
resp = requests.get(
"https://api.crawlora.net/api/v1/reddit/search",
headers={"x-api-key": "YOUR_API_KEY"},
params={"q": "web scraping", "sort": "top", "limit": 25},
)
for post in resp.json()["data"]["posts"]:
print(post["score"], post["subreddit"], post["title"])
Obtienes posts, comentarios y feeds como JSON limpio, y dejas de perseguir los cambios de Reddit — ese es el trato que estás comprando.
Una nota sobre cumplimiento
Los términos actualizados de la Data API y la Rule 8 de Reddit ahora cubren explícitamente el abuso automatizado y el scraping no autorizado, y el cambio de mayo de 2026 deja clara la postura de Reddit. Elijas la vía que elijas:
- Recolecta solo posts, comentarios y subreddits públicos — nunca datos privados, en cuarentena o personales.
- Trata los nombres de usuario y el texto de los comentarios como datos personales (RGPD/CCPA) — minimiza lo que almacenas y ten una base legal, sobre todo para uso en entrenamiento de AI.
- Prefiere la API oficial o una vía licenciada/gestionada, y revisa los términos de Reddit y tu legislación local antes de un uso comercial o de AI.
Esto no es asesoría legal — consulta ¿Es legal el web scraping en 2026? para el detalle de datos públicos frente a datos personales.
Fuentes
Dónde encaja esto
La era de añadir .json se acabó, pero Reddit sigue siendo una de las fuentes más ricas para la investigación de comunidades, el sentimiento de marca y producto, y datos de grounding para AI. Para la guía práctica (búsqueda, posts, comentarios, feeds de subreddits, paginación), consulta cómo hacer scraping de Reddit en 2026; para alimentar hilos en un pipeline de recuperación o en un agente, consulta la integración con MCP y el flujo de trabajo de datos web para agentes de AI.
Pruébalo primero, gratis: prueba el endpoint en el Playground, lee el esquema en los docs de la API y revisa los costes en credits en la página de precios.
Preguntas frecuentes
¿Por qué Reddit bloqueó los endpoints .json sin autenticar?
El 28 de mayo de 2026, Reddit anunció que dejaría de dar soporte al acceso .json sin autenticar para frenar el scraping «sin rendición de cuentas» y contener el abuso de bots y agentes. El motivo más grande es comercial: los datos de Reddit son ahora un activo licenciado para el entrenamiento de AI (acuerdos con Google y OpenAI valorados en ~$130M en 2024), y la ruta gratuita de .json dejaba que cualquiera —en especial empresas de AI— se llevara esos datos sin pagar.
¿Siguen funcionando las URLs .json de Reddit en 2026?
No. Desde finales de mayo de 2026, añadir .json a una URL de Reddit devuelve 403 Forbidden en solicitudes sin autenticar. Las sesiones con sesión iniciada y la API oficial de OAuth siguen funcionando, y Reddit ha señalado RSS como la próxima superficie que podría cerrar.
¿Por qué mi scraper de Reddit recibe un 403 incluso con User-Agent?
Porque el bloqueo ya no depende de la tasa ni de los headers. Reddit usa fingerprinting de TLS y comprobaciones de reputación de IP, así que los clientes genéricos (requests, wget, curl por defecto) y las IPs de datacenter o de la nube reciben un 403 incluso con un User-Agent válido. El fallback anónimo de .json que absorbía esto antes ya no existe.
¿Cuál es ahora la forma oficial de conseguir datos de Reddit?
La Data API autenticada de Reddit (OAuth) y la plataforma de desarrollo Devvit. Es gratis para uso no comercial con un límite de unas 100 requests/minute; el acceso comercial cuesta alrededor de $0.24 por 1.000 requests, con acuerdos empresariales desde unos $12,000/año.
¿Es legal o está permitido hacer scraping de Reddit en 2026?
La Rule 8 y los Data API Terms actualizados de Reddit restringen el scraping no autorizado. Los datos públicos suelen ser accesibles, pero recolecta solo contenido público, trata los nombres de usuario y los comentarios como datos personales, y prefiere la API oficial o una vía licenciada/gestionada — revisa los términos de Reddit y tu legislación local antes de un uso comercial o de AI. Esto no es asesoría legal.
¿Cómo sigo obteniendo datos de Reddit sin mantener un scraper?
Una API gestionada como Crawlora devuelve JSON normalizado para búsquedas, posts, hilos de comentarios y feeds de subreddits de Reddit desde una sola key, y mantiene la vía de acceso funcionando a medida que Reddit la endurece — así evitas la autenticación, los proxies, el fingerprinting y las caídas constantes.