Rangerer apps med 4,8-stjernet bedømmelse højere? Vi analyserede 1.000 App Store-søgninger
Apple nævner vurderinger som et rangeringsinput, så folkloren følger: kom til 4,8, og du stiger. Vi tog 1.000 resultatsæt, 18.796 individuelle søgeresultater, og kiggede. Stjerneværdien forklarer næsten intet. Antallet af vurderinger forklarer seks gange mere.
Hvorfor spørgsmålet fortjener ordentlig undersøgelse
Apple siger, at søgeresultater bygger på “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Det vil sige tekstrelevans og brugeradfærd. Den ene sætning er ophavet til meget rådgivning om at hæve stjernegennemsnittet, ofte med 4.8 som den afgørende tærskel.
Men “ratings and reviews” er tvetydigt netop dér, hvor det tæller. Det kan være stjerneværdien, antallet af personer, som gav en, eller begge. Det kræver forskelligt arbejde: at hæve gennemsnittet er et produktproblem; at hæve antallet er et distributionsproblem.
Metode
Vi indsamler daglige resultater for kundernes termer. Vi tog hver unik term og hvert land i de syv dage frem til 12 september 2026, én gang ved seneste observation, og beholdt grupper, hvor mindst otte af top 20 havde både stjerner og antal på fil. Det giver 1,000 grupper og 18,796 individuelle resultater.
Hver term skal tælles én gang. Samme søgning på sammenhængende dage giver næsten samme apps i samme rækkefølge. Dobbelt optælling fordobler stikprøven uden information og får tallene til at se sikrere ud.
Det rå billede: næsten fladt
Der er en meget lille hældning. Den bedst bedømte gruppe er ikke bedst placeret: 4.5-4.7 er lidt foran. Under 4.5 er forskellen cirka én plads af tyve, og under-3.0-gruppen slår 3.0-3.9. Den slags inversion opstår, når en effekt mest er støj.
Et negativt tal betyder, at den højere værdi ligger nærmere førstepladsen. Det gør begge, men antallet er omtrent seks gange stærkere. Ingen sammenhæng er stor: selv antallet forklarer kun få procent af placeringen. Det minder os om, at relevans snarere end popularitet gør det meste af arbejdet i søgningen.
Den forstyrrende faktor og dens fjernelse
Stjerner og antal følges ad, så en rå sammenligning skiller dem ikke. Gruppen 4.5-4.7 har median 13,507 bedømmelser, mens 3.0-3.9 har 72. Det er mest en sammenligning af store og små apps.
Vi delte derfor de samme placeringer i grupper med lignende antal og så på stjerneeffekten inden for dem, hvor den forstyrrende faktor holdes nogenlunde fast.
Læs ned gennem en kolonne, og størrelseseffekten er tydelig: samme stjernegruppe flytter fra cirka plads 12 til 9, når antallet vokser. På tværs er stjerneeffekten lille, inkonsekvent og omvendt i den mindste gruppe: 4.8-5.0 med under 200 bedømmelser lå lavest i tabellen.
Inversionen er ikke mystisk. Et gennemsnit på 4.9 fra 30 anmeldelser tilhører normalt en meget lille app, og det er størrelsen, der ses i placeringen. Det viser, hvorfor den rå hældning ikke skal læses som en stjerneeffekt.
En renere test: sammenlign inden for samme resultatgruppe
En finansfrase sammenlignet med en puslespilsfrase er to forskellige populationer. Top tre sammenlignet med plads 8-20 i samme søgning er ikke. Vi udførte den parrede test på 990 resultatgrupper med nok bedømte apps i begge ender.
Apps i toppen har 0.023 flere stjerner end dem i bunden. De har cirka ni gange så mange bedømmelser. Den højere bedømte gruppe holdt top tre i 52.6% af grupperne og bunden i 22.8%. Retningen er reel, men størrelsen ubetydelig.
Hvad litteraturen siger
Spørgsmålet er ikke nyt akademisk, og litteraturen lander lignende. Sällberg, Wang og Numminen i Journal of Marketing Analytics i 2022 fulgte 341 apps dagligt i cirka to år fra App Store-lancering og skilte bedømmelsesdata fra anmeldelsestekst. For produktivitet havde gennemsnittet ingen signifikant direkte effekt på downloads, mens volumen havde. For spil var volumeneffekten negativ, en advarsel mod at se det som simple greb.
Visuelle studier viser også grænsen for én-variabel-tænkning. Wang og Li i Electronic Commerce Research i 2016 udtrak farve, kompleksitet og symmetri fra Android-ikoner og fandt målbare sammenhænge med downloads. Feltet app store mining blev indledt af Harman, Jia og Zhang på MSR 2012, som viste, at metadata overhovedet kan analyseres i stor skala.
Hvad det betyder for din side
Studiets begrænsninger
Én uge, kun iOS og de 3,564 termer vores indsamler følger, med vægt på kundernes kategorier frem for et tilfældigt App Store-udsnit. Antallet er en støjfyldt indikator for installationsbasen, da apps spørger med meget forskellig frekvens. Placering er observationel: vi kan ikke randomisere gennemsnittet, så dette er ikke et kausalt estimat. En så lille korrelation ville blive overdøvet af en umodelleret kategoriforskel.
Tilbage står sammenligningen mellem to signaler målt ens på samme data. Enhver skævhed rammer begge, og antallet er stadig cirka seks gange stærkere.
AsoTheory: sådan fungerer scorerne
Relateret
- Gratis app-rangsporer: en praktisk arbejdsgang for små teams
- Fra søgeordsforskning til en fortegnelsestest
- data.ai-alternativer til indie-udviklere
- Tilpassede produktsider kan nu vinde organisk App Store-søgetrafik. De fleste udviklere har ikke slået det til
Blog · Casestudier · Free ASO tools · Produkter · Privatliv og vilkår · AsoTheory