Les aplicacions amb valoracions de 4,8 estrelles es posicionen més amunt? Hem analitzat 1.000 cerques a l'App Store
Apple esmenta les valoracions com a factor de posicionament, així que el folklore diu: arriba a 4,8 i pujaràs. Vam agafar 1.000 conjunts de resultats, 18.796 resultats de cerca individuals, i vam mirar. El valor de les estrelles no explica gairebé res. El nombre de valoracions n'explica sis vegades més.
Per què val la pena fer la pregunta correctament
Apple afirma que els resultats de cerca es basen en “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Aquesta única frase és l'origen d'una enorme quantitat de consells sobre perseguir una mitjana d'estrelles més alta, normalment amb 4.8 com a llindar que importa.
Però “ratings and reviews” és ambigu exactament en el lloc que importa. Podria significar el valor d'estrelles, o el nombre de persones que en van deixar una, o tots dos. Són coses diferents i impliquen feina completament diferent: augmentar una mitjana és un problema de producte, i augmentar un recompte és un problema de distribució.
Mètode
Recollim resultats de cerca diaris per als termes que segueixen els nostres clients. Per a aquest estudi vam prendre cada terme i país diferent que el col·lector va veure en els set dies fins al 12 de setembre de 2026, cadascun comptat una vegada en la seva observació més recent, i vam mantenir conjunts de resultats on almenys vuit de les apps del top 20 tenien tant un valor d'estrelles com un recompte de valoracions a l'arxiu. Això dóna 1,000 conjunts de resultats i 18,796 resultats de cerca individuals.
Prendre cada terme una vegada importa. La mateixa cerca en dies consecutius retorna gairebé les mateixes apps en gairebé el mateix ordre, així que comptar-la dues vegades duplicaria la mostra sense afegir cap informació i faria que cada xifra sembli més certa del que és.
La imatge crua: gairebé plana
Hi ha un gradient, i és minúscul. La franja amb millor valoració no és la franja amb millor posició: 4.5-4.7 la supera. Per sota de 4.5 la diferència és d'aproximadament una posició de vint, i el grup de menys de 3.0 es col·loca millor que el grup 3.0-3.9, que és el tipus d'inversió que veus quan un efecte és majoritàriament soroll.
Un nombre negatiu significa que el valor més alt se situa més a prop de la posició u. Tots dos ho fan, i el recompte és aproximadament sis vegades el senyal més fort. Cap dels dos és gran: fins i tot el recompte explica només un petit percentatge d'on se situa una app, la qual cosa és un recordatori útil que la rellevància, no la popularitat, fa la major part de la feina en un resultat de cerca.
El factor de confusió, i què passa quan l'elimines
Les estrelles i els recomptes de valoracions viatgen junts, així que una comparació crua no els pot separar. A la nostra mostra la franja 4.5-4.7 té una mediana de 13,507 valoracions i la franja 3.0-3.9 té 72. Comparar aquests dos grups és majoritàriament comparar apps grans amb petites.
Així que vam dividir les mateixes posicions en franges de recompte de valoracions similars i vam mirar l'efecte de les estrelles dins de cada franja, on el factor de confusió es manté en gran part quiet.
Llegeix cap avall una columna i l'efecte de l'escala és obvi: la mateixa franja d'estrelles es mou d'aproximadament la posició 12 a aproximadament la posició 9 a mesura que creix el recompte de valoracions. Llegeix a través d'una fila i l'efecte de les estrelles és petit, inconsistent, i a la franja més petita va enrere — les apps valorades 4.8-5.0 amb menys de 200 valoracions es van situar les més baixes de qualsevol grup de la taula.
Aquesta inversió no és misteriosa. Una mitjana de 4.9 de 30 ressenyes normalment pertany a una app molt petita, i ser molt petita és el que es mostra a la posició. És una demostració clara de per què el gradient cru no s'ha de llegir com un efecte de les estrelles.
Una prova més neta: compara dins d'un mateix conjunt de resultats
Comparar un terme de finances amb un terme de joc de trencaclosques compara dues poblacions diferents. Comparar els tres primers amb les posicions 8-20 de la mateixa cerca no. Vam executar aquesta prova aparellada en els 990 conjunts de resultats amb prou apps puntuades als dos extrems.
Les apps al capdamunt d'un conjunt de resultats estan valorades 0.023 estrelles més alt que les apps al fons. Tenen aproximadament nou vegades més valoracions. El grup amb valoració més alta va ocupar els tres primers en 52.6% dels conjunts i el fons en 22.8%, així que la direcció és real — és la mida la que és negligible.
Què diu la literatura
Aquesta no és una pregunta nova acadèmicament, i el treball publicat aterra en un lloc similar. Sällberg, Wang i Numminen, escrivint al Journal of Marketing Analytics el 2022, van seguir 341 apps diàriament durant aproximadament dos anys des del seu llançament a l'App Store i van separar la informació de valoració del text de la ressenya. Per a apps de productivitat informen que la puntuació mitjana de valoració no tenia cap efecte directe significatiu en les descàrregues, mentre que el volum de valoracions sí. Per a apps de jocs l'efecte del volum era negatiu, la qual cosa és en si mateixa un advertiment contra tractar qualsevol d'aquests com a palanques simples.
El treball sobre actius visuals apunta en la mateixa direcció sobre els límits del pensament d'una sola variable: Wang i Li, a Electronic Commerce Research el 2016, van extreure característiques de color, complexitat i simetria de les icones d'Android i van trobar relacions mesurables amb el comportament de descàrrega. El camp més ampli de la mineria de botigues d'apps es va obrir amb Harman, Jia i Zhang a MSR 2012, que va establir que les metadades de la botiga es poden analitzar a escala en absolut.
Què significa això per a la teva fitxa
Límits d'aquest estudi
Una setmana, només iOS, i els 3,564 termes que segueix el nostre col·lector, que s'inclinen cap a les categories en què treballen els nostres clients més que cap a una mostra aleatòria de l'App Store. El recompte de valoracions és un indicador de la base d'instal·lacions i un de sorollós, ja que les apps demanen valoracions a ritmes molt diferents. La posició és observacional: no podem aleatoritzar la mitjana d'estrelles d'una app, així que res aquí és una estimació causal. I una correlació tan petita quedaria ofegada per qualsevol efecte de categoria que no hàgim modelat.
El que sobreviu a aquests límits és la comparació entre dos senyals mesurats de la mateixa manera sobre les mateixes dades. Qualsevol biaix que hi hagi a la nostra mostra s'aplica a tots dos, i el recompte encara supera el valor d'estrelles aproximadament sis a un.
AsoTheory, com funcionen les puntuacions
Relacionat
- Rastrejador gratuït de rànquing d'aplicacions: un flux de treball pràctic per a equips petits
- De la recerca de paraules clau a una prova de fitxa
- alternatives a data.ai per a desenvolupadors indie
- Les pàgines de producte personalitzades ara poden guanyar trànsit de cerca orgànica a l'App Store. La majoria de desenvolupadors no ho han activat
Blog · Estudis de cas · Free ASO tools · Productes · Privacitat i termes · AsoTheory