Rankar appar med 4,8-stjärniga betyg högre? Vi analyserade 1 000 App Store-sökningar

Apple nennt Bewertungen als Ranking-Eingabe, also folgt die Folklore: Erreiche 4,8 und du steigst auf. Wir haben 1.000 Ergebnissätze, 18.796 einzelne Suchergebnisse genommen und nachgesehen. Der Sternwert erklärt fast nichts. Die Anzahl der Bewertungen erklärt sechsmal mehr.

Varför frågan är värd att ställa ordentligt

Apple anger att sökresultat baseras på “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Den enda meningen är ursprunget till en enorm mängd råd om att jaga ett högre stjärnsnitt, vanligtvis med 4.8 utpekad som den tröskel som spelar roll.

Men “ratings and reviews” är tvetydigt precis på det ställe som spelar roll. Det kan betyda stjärnvärdet, eller antalet personer som lämnade ett, eller båda. Det är olika saker och de innebär helt olika arbete: att höja ett genomsnitt är ett produktproblem, och att höja ett antal är ett distributionsproblem.

Metod

Vi samlar in dagliga sökresultat för de termer våra kunder spårar. För den här studien tog vi varje distinkt term och land som insamlaren såg under de sju dagarna fram till 12 september 2026, var och en räknad en gång vid sin senaste observation, och behöll resultatlistor där minst åtta av topp 20-apparna hade både ett stjärnvärde och ett antal betyg registrerat. Det ger 1,000 resultatlistor och 18,796 individuella sökresultat.

Att ta varje term en gång spelar roll. Samma sökning på varandra följande dagar returnerar nästan samma appar i nästan samma ordning, så att räkna den två gånger skulle dubbla urvalet utan att lägga till någon information och skulle få varje siffra att se säkrare ut än den är.

Den råa bilden: nästan platt

Det finns en lutning, och den är liten. Det bäst betygsatta bandet är inte det bäst placerade bandet: 4.5-4.7 slår det. Under 4.5 är skillnaden ungefär en position av tjugo, och gruppen under 3.0 placerar sig bättre än gruppen 3.0-3.9, vilket är den typ av inversion man ser när en effekt mestadels är brus.

Ett negativt tal betyder att det högre värdet ligger närmare position ett. Båda gör det, och antalet är ungefär sex gånger den starkare signalen. Ingen av dem är stor: till och med antalet förklarar bara några få procent av var en app hamnar, vilket är en användbar påminnelse om att relevans, inte popularitet, gör det mesta av jobbet i ett sökresultat.

Störfaktorn, och vad som händer när du tar bort den

Stjärnor och antal betyg följs åt, så en rå jämförelse kan inte skilja dem åt. I vårt urval har bandet 4.5-4.7 en median på 13,507 betyg och bandet 3.0-3.9 har 72. Att jämföra de två grupperna är mestadels att jämföra stora appar med små.

Så vi delade upp samma placeringar i band med liknande antal betyg och tittade på stjärneffekten inom varje band, där störfaktorn i stort sett hålls stilla.

Läs nedåt i en kolumn och effekten av skala är uppenbar: samma stjärnband rör sig från ungefär position 12 till ungefär position 9 när antalet betyg växer. Läs över en rad och stjärneffekten är liten, inkonsekvent, och i det minsta bandet går den baklänges — appar med betyg 4.8-5.0 med under 200 betyg satt lägst av alla grupper i tabellen.

Den inversionen är inte mystisk. Ett 4.9-genomsnitt från 30 recensioner tillhör vanligtvis en mycket liten app, och att vara mycket liten är det som syns i positionen. Det är en ren demonstration av varför den råa lutningen inte bör läsas som en stjärneffekt.

Ett renare test: jämför inom en och samma resultatlista

Att jämföra en finanterm mot en pusselspelsterm jämför två olika populationer. Att jämföra topp tre mot positionerna 8-20 i samma sökning gör det inte. Vi körde det parade testet på de 990 resultatlistor som hade tillräckligt många betygsatta appar i båda ändar.

Apparna i toppen av en resultatlista är betygsatta 0.023 stjärnor högre än apparna i botten av den. De har ungefär nio gånger så många betyg. Den högre betygsatta gruppen höll topp tre i 52.6% av listorna och botten i 22.8%, så riktningen är verklig — det är storleken som är försumbar.

Vad litteraturen säger

Det här är inte en ny fråga akademiskt, och den publicerade forskningen landar på ett liknande ställe. Sällberg, Wang och Numminen, som skriver i Journal of Marketing Analytics år 2022, följde 341 appar dagligen i ungefär två år från deras App Store-lansering och separerade betygsinformation från recensionstext. För produktivitetsappar rapporterar de att genomsnittligt betyg inte hade någon signifikant direkt effekt på nedladdningar, medan volymen av betyg hade det. För spelappar var volymeffekten negativ, vilket i sig är en varning mot att behandla något av dessa som enkla spakar.

Arbete med visuella tillgångar pekar åt samma håll om gränserna för tänkande med en enda variabel: Wang och Li, i Electronic Commerce Research år 2016, extraherade färg-, komplexitets- och symmetriegenskaper från Android-ikoner och fann mätbara samband med nedladdningsbeteende. Det bredare fältet app store mining öppnades av Harman, Jia och Zhang vid MSR 2012, som fastställde att butiksmetadata kan analyseras i stor skala överhuvudtaget.

Vad detta betyder för din butikssida

Begränsningar i denna studie

En vecka, endast iOS, och de 3,564-termer som vår insamlare följer, vilka lutar mot de kategorier våra kunder arbetar inom snarare än ett slumpmässigt urval av App Store. Antal betyg är en proxy för installationsbas och en brusig sådan, eftersom appar uppmanar i mycket olika takt. Position är observationell: vi kan inte randomisera en apps stjärnsnitt, så inget här är en kausal uppskattning. Och en så här liten korrelation skulle översköljas av vilken kategorieffekt som helst som vi inte har modellerat.

Det som överlever dessa begränsningar är jämförelsen mellan två signaler mätta på samma sätt på samma data. Vilken bias som än finns i vårt urval gäller båda, och antalet överträffar fortfarande stjärnvärdet med ungefär sex till ett.

Slå upp ett sökord gratis

Slå upp ett sökord gratis

AsoTheory, hur poängen fungerar

Relaterad

Blog · Fallstudier · Free ASO tools · Produkter · Integritet och villkor · AsoTheory