Ranken Apps mit 4,8-Sterne-Bewertungen höher? Wir haben 1.000 App Store-Suchen analysiert

Apple nennt Bewertungen als Ranking-Eingabe, also folgt die Folklore: Erreiche 4,8 und du steigst auf. Wir haben 1.000 Ergebnissätze, 18.796 einzelne Suchergebnisse genommen und nachgesehen. Der Sternwert erklärt fast nichts. Die Anzahl der Bewertungen erklärt sechsmal mehr.

Warum die Frage es wert ist, richtig gestellt zu werden

Apple gibt an, dass Suchergebnisse auf “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)” basieren. Dieser eine Satz ist der Ursprung einer enormen Menge an Ratschlägen darüber, einen höheren Sterne-Durchschnitt zu verfolgen, meist mit 4.8 als der Schwelle, die zählt.

Aber “ratings and reviews” ist genau an der Stelle mehrdeutig, die zählt. Es könnte den Sternwert bedeuten oder die Anzahl der Personen, die einen hinterlassen haben, oder beides. Das sind verschiedene Dinge und sie implizieren völlig unterschiedliche Arbeit: Einen Durchschnitt zu erhöhen ist ein Produktproblem, und eine Anzahl zu erhöhen ist ein Verteilungsproblem.

Methode

Wir sammeln tägliche Suchergebnisse für die Begriffe, die unsere Kunden verfolgen. Für diese Studie haben wir jeden unterschiedlichen Begriff und jedes Land genommen, das der Collector in den sieben Tagen bis zum 12 September 2026 gesehen hat, jeweils einmal bei seiner jüngsten Beobachtung gezählt, und Ergebnislisten behalten, bei denen mindestens acht der Top-20-Apps sowohl einen Sternwert als auch eine Bewertungsanzahl in der Datei hatten. Das ergibt 1,000 Ergebnislisten und 18,796 einzelne Suchergebnisse.

Jeden Begriff einmal zu nehmen, zählt. Dieselbe Suche an aufeinanderfolgenden Tagen liefert fast dieselben Apps in fast derselben Reihenfolge, daher würde das doppelte Zählen die Stichprobe verdoppeln, ohne Informationen hinzuzufügen, und jede Zahl sicherer aussehen lassen, als sie ist.

Das rohe Bild: fast flach

Es gibt einen Gradienten, und er ist winzig. Das am besten bewertete Band ist nicht das am besten platzierte Band: 4.5-4.7 schlägt es knapp. Unter 4.5 beträgt der Unterschied etwa eine Position von zwanzig, und die Unter-3.0-Gruppe platziert besser als die 3.0-3.9-Gruppe, was die Art von Umkehrung ist, die man sieht, wenn ein Effekt größtenteils Rauschen ist.

Eine negative Zahl bedeutet, dass der höhere Wert näher an Position eins liegt. Beide tun das, und der Zähler ist ungefähr sechsmal so stark wie das Signal. Keiner ist groß: Selbst der Zähler erklärt nur wenige Prozent davon, wo eine App sitzt, was eine nützliche Erinnerung daran ist, dass Relevanz, nicht Beliebtheit, die meiste Arbeit in einem Suchergebnis leistet.

Der Störfaktor und was passiert, wenn du ihn entfernst

Sterne und Bewertungsanzahlen reisen zusammen, daher kann ein roher Vergleich sie nicht trennen. In unserer Stichprobe hat das 4.5-4.7-Band einen Median von 13,507 Bewertungen und das 3.0-3.9-Band hat 72. Diese beiden Gruppen zu vergleichen, ist größtenteils ein Vergleich großer Apps mit kleinen.

Also haben wir dieselben Platzierungen in Bänder ähnlicher Bewertungsanzahl aufgeteilt und den Sterneffekt innerhalb jedes Bandes betrachtet, wo der Störfaktor weitgehend stillgehalten wird.

Lies eine Spalte hinunter und der Effekt der Skala ist offensichtlich: Dasselbe Sternband bewegt sich von etwa Position 12 zu etwa Position 9, wenn die Bewertungsanzahl wächst. Lies quer über eine Zeile und der Sterneffekt ist klein, inkonsistent und läuft im kleinsten Band rückwärts – Apps mit 4.8-5.0 Sternen und unter 200 Bewertungen saßen am niedrigsten von jeder Gruppe in der Tabelle.

Diese Umkehrung ist nicht mysteriös. Ein 4.9-Durchschnitt aus 30 Bewertungen gehört normalerweise zu einer sehr kleinen App, und sehr klein zu sein ist das, was sich in der Position zeigt. Es ist eine saubere Demonstration, warum der rohe Gradient nicht als Sterneffekt gelesen werden sollte.

Ein saubererer Test: Vergleich innerhalb einer Ergebnisliste

Einen Finanzbegriff mit einem Puzzle-Spiel-Begriff zu vergleichen, vergleicht zwei verschiedene Populationen. Die Top Drei mit den Positionen 8-20 derselben Suche zu vergleichen, tut das nicht. Wir haben diesen gepaarten Test auf den 990 Ergebnislisten mit genügend bewerteten Apps an beiden Enden durchgeführt.

Die Apps oben in einer Ergebnisliste sind 0.023 Sterne höher bewertet als die Apps unten darin. Sie haben ungefähr neunmal so viele Bewertungen. Die höher bewertete Gruppe hielt die Top Drei in 52.6% der Listen und die unteren in 22.8%, daher ist die Richtung real – es ist die Größe, die vernachlässigbar ist.

Was die Literatur sagt

Dies ist akademisch keine neue Frage, und die veröffentlichte Arbeit landet an einem ähnlichen Ort. Sällberg, Wang und Numminen, die im Journal of Marketing Analytics in 2022 schreiben, verfolgten 341 Apps täglich für etwa zwei Jahre ab ihrem App Store-Start und trennten Bewertungsinformationen von Bewertungstext. Für Produktivitäts-Apps berichten sie, dass die durchschnittliche Bewertungspunktzahl keinen signifikanten direkten Effekt auf Downloads hatte, während das Volumen der Bewertungen dies tat. Für Gaming-Apps war der Volumeneffekt negativ, was selbst eine Warnung davor ist, irgendetwas davon als einfache Hebel zu behandeln.

Arbeiten zu visuellen Assets weisen in dieselbe Richtung bezüglich der Grenzen des Einzelvariablen-Denkens: Wang und Li extrahierten in Electronic Commerce Research in 2016 Farb-, Komplexitäts- und Symmetriemerkmale aus Android-Icons und fanden messbare Beziehungen zum Download-Verhalten. Das breitere Feld des App-Store-Mining wurde mit Harman, Jia und Zhang bei MSR 2012 eröffnet, die feststellten, dass Store-Metadaten überhaupt in großem Maßstab analysiert werden können.

Was das für dein Listing bedeutet

Grenzen dieser Studie

Eine Woche, nur iOS, und die 3,564 Begriffe, denen unser Collector folgt, die eher zu den Kategorien tendieren, in denen unsere Kunden arbeiten, als zu einer Zufallsstichprobe des App Store. Die Bewertungsanzahl ist ein Proxy für die Installationsbasis und ein verrauschter, da Apps mit sehr unterschiedlichen Raten dazu auffordern. Die Position ist beobachtend: Wir können den Sterne-Durchschnitt einer App nicht randomisieren, daher ist nichts hier eine kausale Schätzung. Und eine so kleine Korrelation würde von jedem Kategorieeffekt, den wir nicht modelliert haben, überschwemmt werden.

Was diese Grenzen überlebt, ist der Vergleich zwischen zwei Signalen, die auf dieselbe Weise an denselben Daten gemessen wurden. Welche Verzerrung auch immer in unserer Stichprobe sitzt, gilt für beide, und die Anzahl übertrifft den Sternwert immer noch um ungefähr sechs zu eins.

Schlage ein Keyword kostenlos nach

Schlage ein Keyword kostenlos nach

AsoTheory, wie die Scores funktionieren

Verwandt

Blog · Fallstudien · Free ASO tools · Produkte · Datenschutz und Bedingungen · AsoTheory