Rangschikken apps met een beoordeling van 4,8 sterren hoger? We analyseerden 1.000 App Store-zoekopdrachten
Apple noemt beoordelingen als een rangschikkingsinput, dus de folklore volgt: bereik 4,8 en je stijgt. We namen 1.000 resultaatsets, 18.796 individuele zoekresultaten, en keken. De sterwaarde verklaart bijna niets. Het aantal beoordelingen verklaart zes keer meer.
Waarom de vraag de moeite waard is om goed te stellen
Apple stelt dat zoekresultaten gebaseerd zijn op “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Die ene zin is de oorsprong van een enorme hoeveelheid advies over het najagen van een hoger sterrengemiddelde, meestal met 4.8 als de drempel die ertoe doet.
Maar “ratings and reviews” is dubbelzinnig precies op de plek die ertoe doet. Het kan de sterrenwaarde betekenen, of het aantal mensen dat er één achterliet, of beide. Dat zijn verschillende dingen en ze impliceren totaal verschillend werk: een gemiddelde verhogen is een productprobleem, en een telling verhogen is een distributieprobleem.
Methode
We verzamelen dagelijks zoekresultaten voor de termen die onze klanten volgen. Voor deze studie namen we elke afzonderlijke term en land die de collector zag in de zeven dagen tot 12 september 2026, elk één keer geteld bij de meest recente observatie, en hielden we resultatensets waar ten minste acht van de top 20 apps zowel een sterrenwaarde als een aantal beoordelingen in het bestand hadden. Dat geeft 1,000 resultatensets en 18,796 individuele zoekresultaten.
Elke term één keer nemen doet ertoe. Dezelfde zoekopdracht op opeenvolgende dagen retourneert bijna dezelfde apps in bijna dezelfde volgorde, dus twee keer tellen zou de steekproef verdubbelen zonder informatie toe te voegen en zou elk cijfer zekerder laten lijken dan het is.
Het ruwe beeld: bijna vlak
Er is een gradiënt, en die is piepklein. De best gewaardeerde band is niet de best geplaatste band: 4.5-4.7 wint het nipt. Onder 4.5 is het verschil ongeveer één positie op twintig, en de onder-3.0-groep plaatst beter dan de 3.0-3.9-groep, wat het soort omkering is dat je ziet wanneer een effect vooral ruis is.
Een negatief getal betekent dat de hogere waarde dichter bij positie één zit. Beide doen dat, en de telling is ruwweg zes keer het sterkere signaal. Geen van beide is groot: zelfs de telling verklaart slechts een paar procent van waar een app staat, wat een nuttige herinnering is dat relevantie, niet populariteit, het meeste werk doet in een zoekresultaat.
De confounder, en wat er gebeurt als je die verwijdert
Sterren en aantallen beoordelingen reizen samen, dus een ruwe vergelijking kan ze niet scheiden. In onze steekproef heeft de 4.5-4.7-band een mediaan van 13,507 beoordelingen en de 3.0-3.9-band 72. Die twee groepen vergelijken is vooral grote apps met kleine vergelijken.
Dus splitsten we dezelfde plaatsingen in banden van vergelijkbaar aantal beoordelingen en keken we naar het sterreneffect binnen elke band, waar de confounder grotendeels stil wordt gehouden.
Lees een kolom naar beneden en het effect van schaal is duidelijk: dezelfde sterrenband beweegt van ongeveer positie 12 naar ongeveer positie 9 naarmate het aantal beoordelingen groeit. Lees een rij over en het sterreneffect is klein, inconsistent, en in de kleinste band loopt het achteruit — apps met 4.8-5.0 sterren en minder dan 200 beoordelingen zaten het laagst van elke groep in de tabel.
Die omkering is niet mysterieus. Een 4.9-gemiddelde van 30 beoordelingen hoort meestal bij een zeer kleine app, en zeer klein zijn is wat in de positie verschijnt. Het is een schone demonstratie waarom de ruwe gradiënt niet als een sterreneffect moet worden gelezen.
Een schonere test: vergelijk binnen één resultatenset
Een financiële term vergelijken met een puzzelspelterm vergelijkt twee verschillende populaties. De top drie vergelijken met posities 8-20 van dezelfde zoekopdracht doet dat niet. We voerden die gepaarde test uit op de 990 resultatensets met genoeg gescoorde apps aan beide uiteinden.
De apps bovenaan een resultatenset zijn 0.023 sterren hoger gewaardeerd dan de apps onderaan. Ze hebben ruwweg negen keer zoveel beoordelingen. De hoger gewaardeerde groep hield de top drie in 52.6% van de sets en de onderkant in 22.8%, dus de richting is echt — het is de grootte die verwaarloosbaar is.
Wat de literatuur zegt
Dit is academisch geen nieuwe vraag, en het gepubliceerde werk komt op een vergelijkbare plek uit. Sällberg, Wang en Numminen, schrijvend in het Journal of Marketing Analytics in 2022, volgden 341 apps dagelijks gedurende ongeveer twee jaar vanaf hun App Store-lancering en scheidden beoordelingsinformatie van reviewtekst. Voor productiviteitsapps rapporteren ze dat de gemiddelde beoordelingsscore geen significant direct effect had op downloads, terwijl het volume van beoordelingen dat wel had. Voor gaming-apps was het volume-effect negatief, wat zelf een waarschuwing is tegen het behandelen van deze als eenvoudige hendels.
Werk aan visuele assets wijst dezelfde kant op over de grenzen van enkelvoudig-variabel denken: Wang en Li, in Electronic Commerce Research in 2016, extraheerden kleur-, complexiteits- en symmetrie-kenmerken uit Android-iconen en vonden meetbare relaties met downloadgedrag. Het bredere veld van app store mining opende met Harman, Jia en Zhang op MSR 2012, dat vaststelde dat store-metadata überhaupt op schaal geanalyseerd kan worden.
Wat dit betekent voor jouw vermelding
Beperkingen van deze studie
Eén week, alleen iOS, en de 3,564 termen die onze collector volgt, die neigen naar de categorieën waarin onze klanten werken in plaats van een willekeurige steekproef van de App Store. Aantal beoordelingen is een proxy voor installatiebasis en een ruisige, omdat apps op zeer verschillende snelheden vragen. Positie is observationeel: we kunnen het sterrengemiddelde van een app niet randomiseren, dus niets hier is een causale schatting. En een correlatie die zo klein is, zou worden overspoeld door elk categorie-effect dat we niet hebben gemodelleerd.
Wat die beperkingen overleeft is de vergelijking tussen twee signalen die op dezelfde manier op dezelfde data zijn gemeten. Welke bias er ook in onze steekproef zit, die geldt voor beide, en de telling presteert nog steeds ruwweg zes tegen één beter dan de sterrenwaarde.
AsoTheory, hoe de scores werken
Gerelateerd
- Gratis app-rangtracker: een praktische workflow voor kleine teams
- Van trefwoordonderzoek naar een vermeldingstest
- data.ai-alternatieven voor indie-ontwikkelaars
- Aangepaste productpagina's kunnen nu organisch App Store-zoekverkeer winnen. De meeste ontwikkelaars hebben dit niet ingeschakeld
Blog · Casestudy's · Free ASO tools · Producten · Privacy en voorwaarden · AsoTheory