Tony Wang7 Min. LesezeitSEC EDGAR scrapen in 2026 (API & Python)
SEC-EDGAR-Filings, Financials und Insider-Daten 2026 holen — EDGARs kostenlose API oder eine strukturierte API für geparste Sektionen und XBRL.
SEC EDGAR ist eine der wenigen Plattformen in dieser Serie, bei der die ehrliche Antwort auf „Muss ich das überhaupt scrapen?" so beginnt: „EDGAR gibt dir das schon kostenlos." Die offiziellen APIs unter data.sec.gov und efts.sec.gov sind öffentlich, unauthentifiziert und liefern Filing-Historie, Submissions und XBRL-Finanzdaten als JSON — kein Key, keine Anmeldung nötig. Was EDGARs eigene API nicht macht: einen 10-K in genau die Risk-Factors-Sektion zerlegen, die du eigentlich brauchst, oder XBRL-Tags in eine normalisierte Gewinn- und Verlustrechnung mit Kennzahlen verwandeln. Dieser Guide zeigt EDGARs eigene kostenlose API mit ihren echten Grenzen, No-Code-Optionen und eine strukturierte API für die Parsing-Arbeit — mit der rechtlichen Realität jeweils vorab erklärt.
Warum SEC EDGAR scrapen?
SEC EDGAR speichert die Filing-Historie jedes börsennotierten US-Unternehmens — das treibt an:
- Financials-Recherche zu Unternehmen — normalisierte Gewinn- und Verlustrechnung, Bilanz und Cashflow-Daten mit Kennzahlen für einen Ticker oder CIK abrufen.
- Filing- und Disclosure-Monitoring — neue 10-K-, 10-Q- und 8-K-Filings verfolgen, sobald sie eingehen, oder die Volltextsuche für ein Thema oder eine Formulierung über alle Filer hinweg erneut laufen lassen.
- Due-Diligence- und Risiko-Recherche — bestimmte Filing-Sektionen (Risk Factors, MD&A) extrahieren, statt ein 100-seitiges Dokument von vorne bis hinten zu lesen.
- Insider- und institutionelle Eigentümeranalyse — Form-4-Insider-Transaktionen und 13F-institutionelle Bestände für ein Unternehmen oder einen Manager nachverfolgen.
- Marktdaten-Abgleich — SEC-Fundamentaldaten mit einem Live-Kurs oder der Marktkapitalisierung von Yahoo Finance oder Google Finance kombinieren.
Ist es legal, SEC EDGAR zu scrapen?
Option 1: EDGARs eigene kostenlose API (und ihre echten Grenzen)
Die Developer-Ressourcen und die EDGAR-APIs-Übersicht der SEC verweisen auf data.sec.gov für Company-Submissions und XBRL-Daten sowie efts.sec.gov für die Volltextsuche — beides öffentliches JSON, kein Key nötig, solange du einen konformen User-Agent mitschickst:
curl "https://data.sec.gov/submissions/CIK0000320193.json" \
-H "User-Agent: YourCompany research@yourcompany.com"
Das liefert Apples komplette Filing-Historie — jeden 10-K, 10-Q, 8-K und Form 4 mit Accession-Number und Dokument-URL — kostenlos, direkt von der SEC. Ein legitimer Weg ohne Anmeldung, um rohe Filing-Metadaten und XBRL-Company-Facts zu bekommen.
Wo es anfängt, echte Engineering-Zeit zu kosten:
- Ein 10-K ist ein Dokument, kein Record.
primary_doc_urlzeigt auf das vollständige Filing-HTML — oft 100+ Seiten. Nur die Risk-Factors- oder MD&A-Sektion zu bekommen heißt, das gesamte Dokument zu holen und das HTML selbst zu parsen; EDGAR segmentiert das nicht für dich. - XBRL-„Frames" brauchen Taxonomie-Wissen. Ein Financial-Concept über Unternehmen hinweg abzurufen (
https://data.sec.gov/api/xbrl/frames/us-gaap/Assets/USD/CY2024Q4I.json) erfordert, den exakten US-GAAP-Tag (Assets,Revenues,NetIncomeLoss, …) und das Periodenformat (CY2024Q4I) zu kennen — es gibt kein Fuzzy-Lookup, und Unternehmen nutzen die Tags unterschiedlich konsistent. - Die Fair-Access-Limits sind real, nicht nur Dekoration. 10 Requests/Sekunde pro IP mit Pflicht-User-Agent ist großzügig für interaktive Lookups, drosselt aber schnell bei einem Bulk-Backfill über Tausende CIKs — für diesen Fall empfiehlt die SEC selbst die nächtlichen Bulk-ZIP-Archive (
companyfacts.zip,submissions.zip), nicht einzelne API-Calls pro Unternehmen.
Option 2: No-Code-Tools
Für SEC-Daten gibt es Marketplace-Scraper-Actors und BI-Connectors, die meist dieselben data.sec.gov-Endpoints kapseln, statt neuen Zugang zu schaffen. Sie sparen Setup-Zeit für einen einmaligen Abzug in eine Tabelle, lösen aber nicht das Parsing-Problem — am Ende kommt immer noch rohes Filing-HTML oder rohe XBRL-Tags heraus, und sie legen eine zusätzliche Indirektionsebene über eine API, die die SEC ohnehin direkt veröffentlicht.
Option 3: Eine strukturierte SEC-EDGAR-API (via Crawlora)
Wenn du eigentlich eine geparste Filing-Sektion oder eine normalisierte Financial-Statement willst — nicht rohes HTML oder XBRL-Tags —, macht genau das eine SEC-EDGAR-API obendrauf auf EDGARs eigene Daten. Suche ein Unternehmen, um dessen CIK zu bekommen:
curl "https://api.crawlora.net/api/v1/sec/company/search?q=apple" \
-H "x-api-key: $CRAWLORA_API_KEY"
{
"code": 200,
"msg": "OK",
"data": {
"query": "apple",
"count": 1,
"matches": [
{ "cik": 320193, "cik_padded": "CIK0000320193", "ticker": "AAPL", "name": "Apple Inc." }
],
"source_url": "https://www.sec.gov/files/company_tickers.json"
}
}
Hol dann in Python die Sektionen eines bestimmten Filings und die normalisierten Financials:
import requests
h = {"x-api-key": "YOUR_API_KEY"}
base = "https://api.crawlora.net/api/v1/sec"
company = requests.get(f"{base}/company/search", headers=h, params={"q": "apple"}).json()["data"]["matches"][0]
cik = company["cik"]
sections = requests.get(f"{base}/filing/sections", headers=h, params={
"ticker": "AAPL", "accession": "0000320193-25-000079", "items": "1A"
}).json()["data"]
financials = requests.get(f"{base}/financials", headers=h, params={
"ticker": "AAPL", "statement": "income", "period": "annual"
}).json()["data"]
filing/sections liefert extrahierten Item-Text statt eines vollständigen HTML-Dokuments (echte Felder — sieh dir die docs an):
{
"data": {
"cik": 320193,
"accession_number": "0000320193-25-000079",
"form": "10-K",
"sections": [
{ "item": "1A", "title": "Risk Factors", "text": "The Company's business...", "char_count": 68562, "truncated": true }
],
"source_url": "https://www.sec.gov/Archives/edgar/data/320193/000032019325000079/aapl-20250927.htm"
}
}
financials liefert normalisierte Zeilen der Gewinn- und Verlustrechnung (oder Bilanz, Cashflow) mit berechneten Kennzahlen, statt roher XBRL-Tags:
{
"data": {
"cik": 320193, "ticker": "AAPL", "statement": "income", "period": "annual",
"line_order": ["revenue", "net_income"],
"periods": [{
"fiscal_year": 2025, "end_date": "2025-09-27", "form": "10-K", "currency": "USD",
"lines": { "revenue": 383285000000, "net_income": 96995000000 },
"ratios": { "gross_margin": 0.4413, "operating_margin": 0.2982, "net_margin": 0.2531, "revenue_growth_yoy": -0.028 }
}]
}
}
/sec/company/submissions (Filing-Historie gefiltert nach form, from/to), /sec/company/intelligence (ein zusammengeführtes Profil, Financial Snapshot und Marktdaten), /sec/full-text-search (q, forms, from/to über alle Filer hinweg), /sec/frames (ein US-GAAP-Concept über Unternehmen hinweg für eine Periode, ohne dass du selbst die Taxonomie-Tag-Liste pflegst), /sec/insider (Form-3/4/5-Transaktionen) und /sec/institutional-holdings (13F-Bestände nach Manager-CIK) runden die Gruppe ab. Speichere eine Zeile pro Filing, Periode oder Transaktion und lass es nach Zeitplan erneut laufen.
Was du sammeln kannst
Öffentliche EDGAR-Filing- und Financial-Daten: Company-Search (CIK, Ticker, Name); Filing-Historie und -Metadaten (Accession-Number, Form-Type, Filing-/Report-Daten, Dokument-URLs, XBRL-Flag); geparste Filing-Sektionen nach Item-Nummer (Risk Factors, MD&A und andere, mit Zeichenanzahl); normalisierte Gewinn- und Verlustrechnung, Bilanz und Cashflow-Daten mit berechneten Kennzahlen und Year-over-Year-Wachstum; ein zusammengeführtes Company-Profil mit Financial Snapshot, Marktdaten und aktuellen Filings; Volltextsuche über alle EDGAR-Filings; XBRL-Concept-Frames über Unternehmen hinweg für eine Periode; Form-3/4/5-Insider-Transaktionen; und 13F-institutionelle Bestände nach Manager.
Grenzen und typische Herausforderungen
- EDGAR selbst ist die kostenlose, offizielle Quelle — wisse, wann eine strukturierte API einen Mehrwert bringt. Rohe Submissions, Filings und XBRL-Fakten gibt es schon kostenlos von
data.sec.gov; eine strukturierte API verdient sich ihren Platz, wenn du geparste Sektionen oder normalisierte Statements brauchst — nicht „Zugang", den du sowieso schon hast. - Die Fair-Access-Limits gelten so oder so. 10 Requests/Sekunde pro IP und ein Pflicht-User-Agent regeln die zugrunde liegenden EDGAR-Calls, egal über welche Schicht du sie aufrufst.
- XBRL-Tagging variiert je nach Unternehmen. Nicht jeder Filer taggt jedes Concept auf dieselbe Weise; manche kleineren Filer haben eine dünnere oder inkonsistentere XBRL-Abdeckung als große „accelerated filer" wie Apple.
- Filing-Text ist lang und item-nummeriert, nicht freiformig. Die Sektionsextraktion hängt davon ab, dass das Filing EDGARs Standard-Item-Nummerierung (1A, 7, 7A, …) folgt — das tun die meisten, aber nicht alle Filings konsequent.
- Nur öffentliche Daten. Das sammelt, was Unternehmen der SEC bereits offengelegt haben und was die SEC bereits veröffentlicht — nie ein Weg, um nicht-öffentliche Informationen abzuleiten oder das tatsächliche Disclosure-Timing eines Unternehmens zu umgehen.
Wo das eingesetzt wird
- Financial Research und Screening — normalisierte Statements und Kennzahlen über eine Watchlist von Tickern hinweg abrufen.
- Due-Diligence-Pipelines — Risk-Factors- und MD&A-Sektionen für KI-gestütztes Review extrahieren, statt manuell zu lesen.
- Compliance- und Disclosure-Monitoring — neue Filings, Insider-Trades und Änderungen bei institutionellen Beständen verfolgen, sobald sie gemeldet werden.
- Quellenübergreifende Financial Research — SEC-Fundamentaldaten mit Live-Preisen von Yahoo Finance oder Google Finance kombinieren.
Sources
Leg los mit dem Sammeln
Probier es zuerst kostenlos aus: jage eine beliebige öffentliche URL durch den Free Web Scraper oder prüfe mit dem Anti-Bot Checker, ob eine Seite Bots blockiert — ohne Anmeldung.
Teste die Company-Search-, Filing-Sections- und Financials-Endpoints im Playground, sieh dir das Schema in den API docs an und wirf einen Blick aufs pricing. SEC EDGAR sagt dir, was ein Unternehmen offiziell offengelegt hat und wann; Yahoo Finance und Google Finance ergänzen den Live-Preis und den Marktkontext drumherum — kombiniere Fundamentaldaten mit Marktdaten, statt einer einzelnen Quelle zu vertrauen. Siehe auch how to choose a web scraping API und is web scraping legal.
Häufig gestellte Fragen
Ist EDGARs eigene API kostenlos? Warum nicht einfach die nutzen?
Ja — data.sec.gov und efts.sec.gov sind kostenlos, offiziell und brauchen keine Anmeldung. Nutze EDGARs eigene API direkt für rohe Filings, Submissions und XBRL-Fakten. Eine strukturierte API lohnt sich, wenn du geparste Filing-Sektionen oder normalisierte Financial Statements mit Kennzahlen statt rohen HTML-Dokumenten und US-GAAP-XBRL-Tags brauchst — der Mehrwert liegt im Parsing, nicht im Zugang, den du nicht schon hattest.
Ist es legal, SEC EDGAR zu scrapen?
SEC-Filings sind öffentliche regulatorische Offenlegungen ohne Login-Schranke oder Scraping-Verbot. Die tatsächliche Einschränkung ist EDGARs Fair-Access-Policy: 10 Requests/Sekunde pro IP und ein Pflicht-User-Agent-Header. Das ist keine Rechtsberatung — siehe is web scraping legal.
Was ist eine CIK und wie bekomme ich eine?
Eine CIK (Central Index Key) ist die eindeutige SEC-Kennung für einen Filer. Du bekommst sie, indem du einen Firmennamen oder Ticker gegen /sec/company/search suchst, das cik, cik_padded, ticker und name zurückgibt.
Wie bekomme ich eine bestimmte Sektion eines 10-K, z. B. Risk Factors?
Übergib die Accession-Number des Filings an /sec/filing/sections mit einem items-Parameter (z. B. "1A" für Risk Factors); es liefert extrahierten Item-Text mit Titel und Zeichenanzahl statt des vollständigen Filing-HTML.
Wie bekomme ich normalisierte Financial Statements statt rohem XBRL?
Rufe /sec/financials mit einer CIK oder einem Ticker, einem statement (income, balance oder cash flow) und einer period (annual oder quarterly) auf; es liefert Zeilenposten und berechnete Kennzahlen wie Gross Margin und Revenue Growth, ohne dass du selbst US-GAAP-Taxonomie-Tags zuordnen musst.
Kann ich Insider-Trades und institutionelle Bestände nachverfolgen?
Ja. /sec/insider liefert Form-3/4/5-Insider-Transaktionen nach CIK oder Ticker, und /sec/institutional-holdings liefert 13F-Bestände nach Manager-CIK, beides als strukturiertes JSON.
Welche SEC-EDGAR-Daten kann ich sammeln?
Company-Search, Filing-Historie und -Metadaten, geparste Filing-Sektionen, normalisierte Financial Statements mit Kennzahlen, ein zusammengeführtes Company-Intelligence-Profil, Volltextsuche über alle Filer, XBRL-Concept-Frames, Insider-Transaktionen und 13F-institutionelle Bestände — alles öffentliche Daten.