Tony Wang5 Min. LesezeitReddit scrapen in 2026 (API & Python)
Drei Wege, Reddit-Posts, -Kommentare und -Subreddits 2026 zu scrapen — DIY-Python, No-Code-Tools oder strukturierte API, samt Rechtsgrundlagen.
Am schnellsten scrapst du Reddit 2026, indem du eine strukturierte API aufrufst, die normalisiertes JSON zurückgibt — Posts, Kommentare und Subreddit-Feeds mit Scores, Autoren und Zeitstempeln — statt dich selbst um Reddits Rate limits und Login-Sperren herumzuarbeiten. Selbermachen ist möglich, aber seit Reddits offizielle Data API 2023 kostenpflichtig und stark im Rate limit begrenzt wurde, geht gelegentliches Scraping schnell kaputt.
Reddit ist eine der am häufigsten zitierten Quellen in KI-Antworten, und genau deshalb sammeln Teams sie für Community-Recherche, Sentiment und Grounding-Daten. Ein strukturierter Endpoint liefert dir die Threads als sauberes JSON, ohne dass du Tokens und Quotas verwalten musst.
Ist es legal, Reddit zu scrapen?
Reddit-Inhalte sind öffentlich, aber Posts und Kommentare werden von Menschen geschrieben, also behandle sie im Zweifel als personenbezogene Daten:
- Sammle nur öffentliche Posts, Kommentare und Subreddits — keine privaten oder unter Quarantäne-Zugriff stehenden Inhalte.
- Reddits offizielle API-Bedingungen und Rate limits existieren; prüfe sie und dein lokales Recht vor kommerzieller Nutzung oder KI-Training.
- Minimiere und schütze alle nutzeridentifizierenden Daten, die du speicherst (Benutzernamen usw.).
- Veröffentliche Inhalte nicht auf eine Weise, die Plattformbedingungen oder die Erwartungen der Nutzer verletzt.
Das ist keine Rechtsberatung — siehe Ist Web Scraping 2026 legal? für die Details zu öffentlich vs. personenbezogen.
Option 1: Selbermachen in Python (und warum es nicht mehr funktioniert)
Jahrelang konntest du Reddits unauthentifizierte .json-Endpoints direkt ansprechen. Damit ist im Mai 2026 Schluss — Reddit hat den unauthentifizierten .json-Zugriff abgeschafft, und der Aufruf unten gibt jetzt 403 Forbidden zurück:
import requests
resp = requests.get(
"https://www.reddit.com/r/webdev/top.json",
params={"limit": 25},
headers={"User-Agent": "my-app/0.1"},
)
data = resp.json()
# ...then handle 429s, pagination cursors, and comment trees yourself
Der wiederkehrende Schmerz:
- Unauthentifiziertes
.jsonist tot (2026). Der Aufruf oben gibt jetzt 403 zurück — siehe warum Reddit es blockiert hat. Selbermachen bedeutet jetzt die authentifizierte OAuth-API oder eine echte, eingeloggte Browser-Session, mit TLS-Fingerprint- und IP-Reputation-Hürden obendrauf. - Auth-Aufwand und Kosten — der offizielle Weg bedeutet OAuth-Apps und Tokens, und Reddits Data API ist jenseits der kostenlosen nicht-kommerziellen Nutzung (100 Requests/Minute) kostenpflichtig: kommerzieller Zugriff kostet etwa $0.24 pro 1.000 Requests, und Enterprise-Verträge beginnen bei knapp $12,000/Jahr.
- Kommentar-Bäume — verschachtelte Antworten erfordern rekursives Durchlaufen und sorgfältiges Flachklopfen.
- Pagination-Cursor —
after-Tokens müssen durch jeden Aufruf durchgereicht werden.
Option 2: No-Code- und Fertig-Tools
Browser-Tools können einen einzelnen Thread greifen, aber Social Listening heißt, viele Subreddits und Suchanfragen über die Zeit zu beobachten und die Historie zu speichern. Das ist eine Pipeline, die eine API besser bedient als ein manueller Export.
Option 3: Eine strukturierte Reddit-API
Crawloras Reddit-API stellt dokumentierte Endpoints für Suche, einzelne Posts, Kommentar-Threads und Subreddit-Feeds bereit und gibt normalisiertes JSON aus einem einzigen API-Key zurück.
curl -G "https://api.crawlora.net/api/v1/reddit/search" \
-H "x-api-key: $CRAWLORA_API_KEY" \
--data-urlencode "q=web scraping" \
--data-urlencode "sort=top" \
--data-urlencode "limit=25"
import requests
resp = requests.get(
"https://api.crawlora.net/api/v1/reddit/search",
headers={"x-api-key": "YOUR_API_KEY"},
params={"q": "web scraping", "sort": "top", "limit": 25},
)
for post in resp.json()["data"]["posts"]:
print(post["score"], post["subreddit"], post["title"])
Eine Antwort ist normalisiertes JSON (die Felder sind beispielhaft — bestätige das Schema in den Docs):
{
"code": 200,
"msg": "OK",
"data": {
"posts": [
{
"id": "abc123",
"subreddit": "webdev",
"title": "Example post title",
"author": "example_user",
"score": 482,
"num_comments": 73,
"created_utc": 1780387665
}
]
}
}
Aus der id eines Posts holst du seine Kommentare, oder du folgst einer Community mit dem Subreddit-Endpoint:
post_id = "abc123"
h = {"x-api-key": "YOUR_API_KEY"}
comments = requests.get(f"https://api.crawlora.net/api/v1/reddit/comments/{post_id}",
headers=h, params={"limit": 100}).json()
hot = requests.get("https://api.crawlora.net/api/v1/reddit/subreddit/webdev/posts",
headers=h, params={"sort": "hot"}).json()["data"]["posts"]
Der Kommentar-Endpoint gibt flache öffentliche Kommentare zurück (kein rekursiver Antwort-Baum zum Durchlaufen), und jede Liste paginiert mit einem after-Token. Das sind dieselben Endpoints hinter der r/SaaS-Fallstudie, auf die in unserer Content- und SEO-Strategie verwiesen wird — speichere eine Zeile pro Post oder Kommentar und lass es geplant erneut laufen für fortlaufendes Social Listening.
Was du sammeln kannst
- Suchergebnisse über ganz Reddit: Titel, Subreddit, Autor, Score und Kommentaranzahl
- Vollständige Post-Details und flache öffentliche Kommentare per
id - Subreddit-Feeds sortiert nach hot, new, top und rising
- Pagination via
after, plustime- undsort-Filter
Einschränkungen und häufige Herausforderungen
- Die offizielle API ist der teure Weg. Die kostenlose Nutzung ist nur nicht-kommerziell und auf 100 Requests/Minute gedeckelt; kommerzieller Zugriff kostet etwa $0.24 pro 1.000 Requests, mit Enterprise-Verträgen ab knapp $12,000/Jahr. Die kostenlosen öffentlichen
.json-Endpoints, auf die Teams früher ausgewichen sind, sind seit Mai 2026 weg, womit nur die kostenpflichtige API oder ein verwalteter Scraper bleibt. - Kommentare kommen flach zurück. Öffentliche Kommentardaten sind eine flache Liste, kein verschachtelter Antwort-Baum — einfacher zu speichern, aber rekonstruiere die Verschachtelung bei Bedarf selbst aus den Parent-IDs.
- Pagination. Listen blättern mit einem
after-Token; reiche es durch jeden Aufruf durch, statt zu erwarten, alles auf einmal zu bekommen. - Benutzernamen sind personenbezogene Daten. Behandle Autoren und Kommentartexte als potenziell personenbezogen nach DSGVO/CCPA — minimiere, was du speicherst, und habe eine Rechtsgrundlage, besonders für KI-Training.
- Rate limits und Sperren beim Selbermachen. Unauthentifizierte Requests bekommen schnell 429er; eine strukturierte API übernimmt Pacing, Proxys und Retries hinter einem einzigen Key.
Quellen
Wo das hineinpasst
Probier es zuerst kostenlos aus: schick eine beliebige öffentliche URL durch den Free Web Scraper, oder prüfe mit dem Anti-Bot-Checker, ob eine Seite Bots blockiert — ohne Anmeldung.
Reddit-Daten treiben Community-Recherche, Marken- und Produkt-Sentiment und Grounding-Daten für KI an. Speise Threads mit der MCP-Integration und dem Workflow KI-Agent-Webdaten in eine Retrieval-Pipeline oder einen Agenten ein, oder verfolge Markenerwähnungen neben dem Bewertungs- und Reputations-Monitoring — und für strukturierte Business-Bewertungen neben Reddits unstrukturiertem Geplauder siehe wie man Trustpilot-Bewertungen scrapt. Für den Rest des Social-Stacks siehe wie man YouTube scrapt, wie man TikTok scrapt wie man LinkedIn scrapt und wie man Twitter/X scrapt; für den breiteren Werkzeugkasten siehe wie man eine Web Scraping API auswählt.
Leg los, indem du den Endpoint im Playground testest, das Request- und Response-Schema in den API-Docs liest und die Credit-Kosten auf der Preisseite durchgehst.
Häufig gestellte Fragen
Kann ich Reddit scrapen, ohne blockiert zu werden?
Crawlora übernimmt Rate limiting, Proxys und Retries hinter der API, sodass du die 429er und die Token-Verwaltung beim direkten Ansprechen von Reddit vermeidest und normalisiertes JSON bekommst.
Hat Reddit noch eine kostenlose API?
Reddits offizielle Data API ist nur für nicht-kommerzielle Nutzung kostenlos und auf 100 Requests/Minute gedeckelt; sie wurde 2023 kostenpflichtig und stark im Rate limit begrenzt. Crawloras Reddit-Endpoints geben öffentliche Posts, Kommentare und Subreddit-Feeds als normalisiertes JSON aus einem einzigen Crawlora-API-Key zurück.
Wie viel kostet die Reddit-API?
Kostenlos für nicht-kommerzielle Nutzung (100 Requests/Minute via OAuth/PRAW). Kommerzieller Zugriff kostet etwa $0.24 pro 1.000 Requests, und Enterprise-Verträge beginnen bei knapp $12,000/Jahr — deshalb nutzen viele Teams inzwischen stattdessen eine verwaltete Scraper-API: Die kostenlosen öffentlichen .json-Endpoints wurden im Mai 2026 abgeschaltet.
Kann ich vollständige Reddit-Kommentar-Threads bekommen?
Crawloras Kommentar-Endpoint gibt flache öffentliche Kommentare für einen Post zurück (er akzeptiert sort und depth aus Kompatibilitätsgründen, aber öffentliche Kommentardaten sind flach). Das ist einfacher zu speichern; rekonstruiere die Verschachtelung bei Bedarf selbst aus den Parent-IDs, wenn du den Antwort-Baum brauchst.
Kann ich private oder personenbezogene Daten scrapen?
Nein. Nur öffentliche Posts, Kommentare und Subreddits sind im Rahmen. Behandle Benutzernamen und Inhalte als personenbezogene Daten und prüfe Reddits Bedingungen und dein lokales Recht vor kommerzieller Nutzung oder KI-Training.
Was kann ich von Reddit sammeln?
Suchergebnisse, vollständige Post-Details, flache öffentliche Kommentare und Subreddit-Feeds, mit sort-, time-, limit- und after-Cursor-Pagination.
Kann ich Reddit-Daten für KI oder RAG nutzen?
Du kannst öffentliche Threads in Retrieval-Pipelines und Agenten einspeisen, zum Beispiel über die MCP-Integration, vorbehaltlich Reddits Bedingungen und des für deinen Anwendungsfall geltenden Rechts.