Tony Wang11 Min. LesezeitWas 1.610 Rezensionen der Claude-App zeigen: Es geht ums Geld, nicht ums Modell
Wir haben 1.610 App-Store-, Google-Play- und Reddit-Beiträge zur Claude-App ausgewertet. In allen drei schlagen Preis und Limits die Qualitätsklagen.
Claude by Anthropic stand den vergangenen Monat in den Top 10 der kostenlosen US-iOS-Charts. Im selben Zeitraum reichte einer der eigenen zahlenden Kunden eine vorgeschlagene bundesweite Sammelklage ein, die Anthropic vorwirft, Abonnent:innen darüber getäuscht zu haben, wie viel sie tatsächlich nutzen dürfen. Wir haben 1.610 echte Rezensionen und Beiträge ausgewertet — 939 aus dem App Store, 279 aus Google Play, 392 aus Reddits r/ClaudeAI — und jeden einzelnen thematisch kodiert. Das Ergebnis bestätigt sich dreifach selbst: Das Lauteste, was Menschen über Claude sagen, hat nichts damit zu tun, wie klug es ist. Es geht um die Rechnung und das Limit.
Drei Korpora, niemand hat sich abgesprochen, dieselbe Antwort
App-Store-Rezensent:innen, Google-Play-Rezensent:innen und Reddit-Poster:innen lesen nicht die Plattformen der anderen. Es sind unterschiedliche Populationen, aus unterschiedlichen Gründen selbst ausgewählt, die in unterschiedlichen Formaten schreiben. Wenn also alle drei unabhängig voneinander dieselbe Form erzeugen, ist dieser Form mehr zu trauen als jeder einzelnen für sich.
Wir haben jede Rezension und jeden Beitrag in acht Themen kodiert — Preis, Nutzungslimits, Bugs, Vergleiche mit Konkurrenz-Apps, „das Modell ist schlechter geworden“-Beschwerden, Sicherheits-Ablehnungen, Verlust von Erinnerung/Kontext und Qualitätslob — mithilfe eines dokumentierten Schlagwort-Klassifikators (Methodik unten). Kombiniert man die zwei geldbezogenen Themen, Preis und Nutzungslimits, zu einem Block, ist er in allen drei Korpora der mit Abstand größte:
Dieser Verbund schlägt jeden anderen Themenblock — auch die, von denen man erwarten würde, dass sie die Rezensionen einer KI-App dominieren:
| Thema | App Store (n=939) | Google Play (n=279) | Reddit (n=392) |
|---|---|---|---|
| Preis + Nutzungslimits | 231 (24,6 %) | 57 (20,4 %) | 108 (27,6 %) |
| Vergleiche mit ChatGPT/Gemini | 220 (23,4 %) | 29 (10,4 %) | 49 (12,5 %) |
| Qualitätslob | 158 (16,8 %) | 45 (16,1 %) | 24 (6,1 %) |
| Bugs / Zuverlässigkeit | 128 (13,6 %) | 27 (9,7 %) | 37 (9,4 %) |
| Sicherheits-Ablehnungen / Sperren | 58 (6,2 %) | 9 (3,2 %) | 28 (7,1 %) |
| Erinnerungs-/Kontextverlust | 16 (1,7 %) | 5 (1,8 %) | 16 (4,1 %) |
| „Schlechter geworden“ / Modell-Verschlechterung | 9 (1,0 %) | 3 (1,1 %) | 10 (2,6 %) |
(Eine Rezension kann mehr als ein Tag tragen, daher summieren sich die Zeilen nicht auf 100 %. „Vergleiche“ ist bidirektional — es erfasst sowohl „viel besser als ChatGPT“ als auch „ChatGPT ist besser als das“ —, behandelt es also als Aufmerksamkeit, nicht als Stimmung.)
Der App-Store-Korpus allein, vollständig aufgeschlüsselt:
Was die Geld-Beschwerden tatsächlich sagen
Das Muster wiederholt sich auf allen drei Plattformen fast wortgleich. Aus dem App Store:
„Garbage can't use a paid $20 subscription to do any work“ — 1★ „I hit my usage limit on Fable 5 with one prompt.“ — 5★ „Literally after 3 prompts, I have reached my limit.“ — 3★
Aus Google Play:
„Every time I start working on something important, I hit another limit.“ — 1★ „the main issue I really hate is the limit, and the super expensive subscription“ — 5★ „Constantly out of tokens, will use all up for a single reply“ — 1★
Und aus Reddits r/ClaudeAI — wo die Beschwerde einen Namen hat (Fable ist eine von Anthropics aktuellen Modellstufen, neben Opus, Sonnet und Haiku):
„I hit the limit right after asking 1 fricking question“ — r/ClaudeAI „Yeah I've hit 75% of my weekly on pro.“ — r/ClaudeAI „$200/month is practically free“ — r/ClaudeAI, in einem Thread, der das Gegenteil vertritt
Der letzte ist kein Tippfehler. r/ClaudeAI ist tatsächlich gespalten zwischen Nutzer:innen, die Claude für das, was es leistet, für unterpreist halten, und solchen, die finden, dass die Nutzungsrechnung nicht aufgeht — was für sich genommen aufschlussreich ist. Niemand in diesem Korpus behauptet, Claude könne nicht schreiben oder denken. Man streitet über den Zähler.
Die Moderator:innen des Subreddits bestätigen das unabhängig von allem, was wir gezählt haben: r/ClaudeAI betreibt feste, angepinnte Sammelthreads mit Titeln wie „Usage Limits Discussion“ und „Performance and Bugs“, dazu ein „user problem report log“, das das Beschwerdevolumen über die Zeit verfolgt. Eine Community baut eigens Infrastruktur für die Beschwerden, die sie nicht abschütteln kann. Niemand hat einen Sammelthread für „Claudes Texte sind langweilig“ gebaut.
Die klarste Bestätigung, dass dies kein bloßes Rauschen aus dem Rezensions-Mining ist: Am 15. Juni 2026 reichte ein Claude-Max-Abonnent eine vorgeschlagene Sammelklage im Northern District of California ein, die behauptet, Anthropics Pläne Max 5x (100 $/Monat) und Max 20x (200 $/Monat) lieferten weit weniger Nutzung als beworben — der Kläger gab an, eine einzige fünfstündige Coding-Sitzung habe rund 15 % seines Wochenkontingents verbraucht. Engadget, Yahoo Finance und vier weitere Medien bestätigten dies unabhängig voneinander. Das ist kein Reddit-Gerücht; es ist dasselbe Preis-/Nutzungslimit-Thema, das unser Rezensions-Mining zutage gefördert hat — jetzt vor einem Bundesgericht.
Eine Top-10-App, und die lauteste Zahl ist die Rechnung
Claude hatte kein Sichtbarkeitsproblem. Mit unserem eigenen App-Store-Rang-Tracking-Datensatz — kein Live-Scrape, sondern ein stehender täglicher Schnappschuss — stand Claude die meiste Zeit des vergangenen Monats in den Top 10 der kostenlosen US-iOS-Apps:
Die Chart-Werte sind Apples Gesamt-Top-Free-Ranking (alle Kategorien), keine kategoriespezifischen Charts.
Eine Top-10-Gratis-App ist kein schwächelndes Produkt. Es ist ein beliebtes, dessen lauteste Beschwerde zufällig ums Geld geht — eine andere, spezifischere Geschichte als „die Leute mögen die KI nicht“.
Geschriebene Rezensionen lügen darüber, wie zufrieden Menschen sind
Bevor wir aus den obigen Zahlen Schlüsse ziehen, ein Ehrlichkeits-Check, den die Daten selbst verlangen: Menschen, die Rezensionen schreiben, sind keine Zufallsstichprobe der Menschen, die die App nutzen.
| Plattform | Stichprobe geschriebener Rezensionen | Anteil 1★ (geschrieben) | Anteil 1★ (echtes Aggregat) |
|---|---|---|---|
| App Store | 939 Rezensionen | 29,6 % | 4,3 % (von 201.437 Bewertungen) |
| Google Play | 279 Rezensionen | 25,4 % | 8,0 % (von 614.011 Bewertungen) |
Auf beiden Plattformen liegt die Ein-Stern-Quote geschriebener Rezensionen 3- bis 6-mal höher als im echten Bewertungs-Aggregat. Claudes tatsächliche App-Store-Bewertung ist 4,72 von 201.437 Bewertungen; die tatsächliche Google-Play-Bewertung ist 4,53 von 614.011. Menschen, die motiviert genug sind, einen Absatz zu tippen, sind im Schnitt wütender als jene, die einen Stern vergeben und weitergegangen sind. Jede Themenzahl in diesem Beitrag beschreibt diesen lautstarken, selbst ausgewählten Ausschnitt — nicht „wie sich Claude-Nutzer:innen fühlen“, was die stille Mehrheit weit positiver beantwortet.
Wie Claude im Vergleich zu den anderen Großen abschneidet
Live abgerufen, am selben Tag, mit derselben Methode, über die fünf größten KI-Assistenten-Apps hinweg:
| App | iOS-Bewertungen (Note) | Android-Bewertungen (Note) |
|---|---|---|
| ChatGPT (OpenAI) | 8.641.725 (4,83) | 51.184.375 (4,77) |
| Grok (xAI) | 1.300.072 (4,88) | 3.490.694 (4,83) |
| Perplexity | 486.341 (4,83) | 2.021.073 (4,58) |
| Gemini (Google) | 1.991.310 (4,72) | 39.712.132 (4,58) |
| Claude (Anthropic) | 201.437 (4,72) | 614.011 (4,53) |
Zwei Dinge fallen auf. Erstens hat Claude auf beiden Plattformen mit Abstand die kleinste Bewertungsbasis der fünf — rund 43-mal weniger iOS-Bewertungen und 83-mal weniger Android-Bewertungen als ChatGPT —, und das ist die eigentliche Schlagzeile über Claudes Consumer-App: Sie ist ein kleiner, schnell wachsender Herausforderer, noch kein Massenmarkt-Platzhirsch, was auch immer der obige Chart-Rang-Moment nahelegt. Zweitens ist Claudes 4,53 auf Android speziell die niedrigste Note der fünf — hinter Gemini und Perplexity, die bei 4,58 gleichauf liegen.
Die Hausindustrie, die Claudes Nutzungslimits hervorgebracht hat
Das klarste Zeichen, dass ein Schmerzpunkt real ist: Fremde bauen unbezahlte Tools, um damit umzugehen. Eine Suche nach Claude-nahen Apps in Google Play fördert „AI Usage: Claude & Gemini“ zutage — eine kostenlose, unabhängige App (4,25★, nicht mit Anthropic verbunden), deren einziger Zweck darin besteht, zu verfolgen, wann sich das Claude-Nutzungsfenster zurücksetzt, diese Rücksetzzeit mit dem Kalender zu synchronisieren und eine Sperrbildschirm-Benachrichtigung zu senden, damit niemand eine Sitzung mit Warten verschwendet.
Reddit bestätigt dieselbe Angst von der Nachfrageseite: Ein Beitragstitel lautet „I built an app to monitor your Claude usage limits in real-time“; ein anderer beschreibt den Bau von „iPhone widgets to make Claude's rate limits easier to see“. Niemand baut ein Widget, um zu verfolgen, wie gut die Texte sind.
Was Bestand hat, und was nicht
Was Bestand hat: Drei unabhängige, sich nicht überschneidende Korpora laufen auf dieselbe Form hinaus — Preis und Nutzungslimits sind das mit Abstand größte Beschwerdethema, vor Bugs, vor Beschwerden über Modellqualität und vor Vergleichen mit Konkurrenten. Eine im selben Monat eingereichte Bundesklage macht dasselbe Argument wie die Rezensionen. Eine Drittanbieter-App existiert einzig, um den Schmerzpunkt zu verwalten. Das sind vier unabhängige Signale, nicht eines.
Was nicht, und die Vorbehalte, die zählen:
- Die Themenklassifikation ist schlagwortbasiert, nicht semantisch. Sie unterzählt alle, die ein Nutzungslimit beschreiben, ohne die entsprechenden Schlagwörter zu benutzen, und eine Rezension kann falsch gezählt werden, wenn sie die Schlagwörter eines Themas in anderem Sinn verwendet. Behandelt die Zahlen als Form, nicht als Zählung.
- Store-Rezensionen sind der wütendste Ausschnitt einer Nutzerbasis, wie der Abschnitt oben zu geschrieben vs. Aggregat direkt zeigt — lest „29,6 % ein Stern“ nicht als „30 % der Claude-Nutzer:innen sind unzufrieden“.
- Reddits öffentlicher Feed zeigt kein Upvote- oder Kommentarzahl-Feld bei Beiträgen (er ist RSS-basiert), daher sind die obigen Beitragszahlen nicht nach Engagement gewichtet; wir haben die eigenen Auto-Mod-Thread-Größen-Angaben des Subreddits als sekundäres, nicht primäres Engagement-Signal genutzt.
- Google Plays Parameter
sort=ratinglieferte ausschließlich Fünf-Sterne-Rezensionen — eine absteigende Score-Sortierung, keine ausgewogene Stichprobe. Die gesamte Abdeckung negativer Rezensionen auf Android stammt aus den Sortierungen „newest“ und „most helpful“. - „Vergleiche mit Konkurrenz“ ist bidirektional und wurde nicht in Lob-für-Claude gegenüber Lob-für-einen-Konkurrenten aufgeteilt; lest es als Aufmerksamkeit für die Wettbewerbsfrage, nicht als Beleg in die eine oder andere Richtung.
- Dies ist eine Momentaufnahme, keine Trendlinie. Wir haben 15 Tage App-Store-Rang-Historie, keine Monate — der Befund „einen Monat lang Top 10“ ist real, aber ein kurzes Fenster.
Quellen
Methodik
Jede Zahl hier wurde am 16. Juli 2026 über Crawloras eigene APIs abgerufen, nicht aus zweiter Hand übernommen: App-Store-Rezensionen und Bewertungen (beide Sortierungen, je 10 Seiten), Google-Play-Rezensionen (Sortierung newest, rating und helpfulness, je 100) und App-Details, Subreddit-Beiträge und Suche über r/ClaudeAI (top/month, top/year, hot, plus drei gezielte Suchen), Thread-Kommentare zu den 12 aussagekräftigsten Threads sowie unser eigenes App-Store-Charts-Dataset für die 15-tägige Rang-Historie.
Korpus: 1.610 Einträge — 939 App-Store-Rezensionen, 279 Google-Play-Rezensionen und 392 Reddit-Beiträge über die Claude-App, alle mithilfe eines dokumentierten Schlagwort-Klassifikators ausgewertet (die Themen-Schlagwortlisten stehen im reproduzierbaren Skript). Wir veröffentlichen ausschließlich Aggregate — keinen rezensent:innenbezogenen Rohtext. Der Aggregat-Datensatz — Themenzahlen, Stern-Verteilungen, Rang-Historie und der Wettbewerbsvergleich — ist auf GitHub unter CC BY 4.0 offen verfügbar.
Reproduziere es selbst im Playground; die Anleitungen App-Store-Rezensionen scrapen, Google Play scrapen und Reddit scrapen führen durch die genauen Aufrufe, und unser App-Rezensions-Sentiment-Dataset enthält Millionen bereits gescrapter Rezensionen, falls du das Crawlen ganz überspringen willst. Für dasselbe Muster, angewendet speziell auf Codex und Claude Code, siehe Codex vs. Claude Code: Was 1.828 Beiträge und Rezensionen sagen.
Häufig gestellte Fragen
Worüber beschweren sich Menschen in Claude-App-Rezensionen am häufigsten?
Preis und Nutzungslimits bilden zusammen mit Abstand das größte Beschwerdethema in drei unabhängigen Korpora, die wir im Juli 2026 ausgewertet haben: 24,6 % von 939 App-Store-Rezensionen, 20,4 % von 279 Google-Play-Rezensionen und 27,6 % von 392 Reddit-Beiträgen in r/ClaudeAI. Das schlägt Bugs, Vergleiche mit ChatGPT und Gemini sowie Beschwerden, dass das Modell selbst schlechter geworden sei. Bugs und Zuverlässigkeitsprobleme sind das zweitgrößte Thema (13,6 % im App Store), gefolgt von Qualitätslob (16,8 %).
Ist Claudes App-Bewertung niedriger als die von ChatGPT und Gemini?
Bei Android ja — Claudes Note von 4,53 (614.011 Bewertungen) ist die niedrigste der fünf großen KI-Assistenten-Apps, die wir verglichen haben, hinter ChatGPT (4,77) und Grok (4,83), und punktgleich mit Perplexity und Gemini (beide 4,58) auf dem zweitletzten Platz. Bei iOS liegt Claudes 4,72 im Mittelfeld, nahe an Geminis 4,72 und hinter ChatGPT (4,83), Grok (4,88) und Perplexity (4,83). Claude hat auf beiden Plattformen zudem mit Abstand die kleinste Bewertungsbasis der fünf — rund 43-mal weniger iOS-Bewertungen und 83-mal weniger Android-Bewertungen als ChatGPT.
Warum wurde Anthropic wegen Claudes Nutzungslimits verklagt?
Am 15. Juni 2026 reichte ein Claude-Max-Abonnent eine vorgeschlagene bundesweite Sammelklage im Northern District of California ein, die behauptet, Anthropics Pläne Max 5x (100 $/Monat) und Max 20x (200 $/Monat) lieferten weit weniger Nutzung als beworben. Der Kläger gab an, eine einzige fünfstündige Coding-Sitzung habe rund 15 % seines Wochenkontingents verbraucht. Die Klage wurde unabhängig voneinander von Engadget, Yahoo Finance und mehreren weiteren Medien gemeldet und spiegelt dieselben Preis-/Nutzungslimit-Beschwerden wider, die unser Rezensions-Mining bei App Store, Google Play und Reddit dominieren.
Sind App-Store-Rezensionen ein verlässliches Maß dafür, wie zufrieden Nutzer sind?
Nicht für sich allein. Geschriebene Rezensionen fallen weit negativer aus als das echte Bewertungs-Aggregat: 29,6 % von Claudes ausgewerteten App-Store-Textrezensionen sind Ein-Stern-Bewertungen, gegenüber 4,3 % von Apples vollständigem Aggregat aus 201.437 Bewertungen. Bei Google Play liegt die Lücke bei 25,4 % (geschriebene Stichprobe) gegenüber 8,0 % (von 614.011 Bewertungen). Menschen, die motiviert genug sind, eine Rezension zu schreiben, sind im Schnitt wütender als die stille Mehrheit, die nur einen Stern vergibt. Lest Rezensions-Themen als Form dessen, worüber lautstarke Nutzer sprechen, nicht als Umfrage zur Gesamtstimmung.
Wie wurde diese Claude-App-Rezensionsstudie durchgeführt?
Wir haben 939 App-Store-Rezensionen (beide Sortierungen mostRecent und mostHelpful, je 10 Seiten), 279 Google-Play-Rezensionen (Sortierung newest, rating und helpfulness, je 100) und 392 Reddit-Beiträge aus r/ClaudeAI (top/month, top/year, hot, plus drei gezielte Suchen) über Crawloras eigene APIs am 16. Juli 2026 abgerufen und dann jeden Eintrag mit einem dokumentierten Schlagwort-Klassifikator in acht Kategorien kodiert. Zusätzlich haben wir die Top-Kommentare der 12 aussagekräftigsten Reddit-Threads sowie 15 Tage von Claudes eigener App-Store-Rang-Historie aus unserem apps-charts-Datensatz abgerufen. Das vollständige reproduzierbare Skript und der committete Aggregat-Datensatz sind im Methodik-Abschnitt des Beitrags verlinkt.