Le app con valutazione 4,8 stelle si posizionano più in alto? Abbiamo analizzato 1.000 ricerche sull'App Store
Apple cita le valutazioni come input di posizionamento, quindi il folklore segue: arriva a 4,8 e sali. Abbiamo preso 1.000 set di risultati, 18.796 risultati di ricerca individuali, e abbiamo guardato. Il valore delle stelle non spiega quasi nulla. Il numero di valutazioni spiega sei volte di più.
Perché vale la pena porre bene la domanda
Apple afferma che i risultati di ricerca si basano su “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Quella singola frase è l'origine di un'enorme quantità di consigli su come inseguire una media di stelle più alta, di solito con 4.8 indicato come la soglia che conta.
Ma “ratings and reviews” è ambiguo proprio nel punto che conta. Potrebbe significare il valore in stelle, o il numero di persone che ne hanno lasciata una, o entrambi. Sono cose diverse e implicano lavori completamente diversi: alzare una media è un problema di prodotto, e alzare un conteggio è un problema di distribuzione.
Metodo
Raccogliamo risultati di ricerca giornalieri per i termini che i nostri clienti tracciano. Per questo studio abbiamo preso ogni termine e paese distinti che il collector ha visto nei sette giorni fino al 12 settembre 2026, ciascuno contato una volta alla sua osservazione più recente, e abbiamo mantenuto i set di risultati in cui almeno otto delle prime 20 app avevano sia un valore in stelle che un conteggio delle valutazioni in archivio. Questo dà 1,000 set di risultati e 18,796 risultati di ricerca individuali.
Prendere ogni termine una volta sola è importante. La stessa ricerca in giorni consecutivi restituisce quasi le stesse app quasi nello stesso ordine, quindi contarla due volte raddoppierebbe il campione senza aggiungere alcuna informazione e farebbe sembrare ogni cifra più certa di quanto non sia.
Il quadro grezzo: quasi piatto
C'è un gradiente, ed è minuscolo. La fascia con la migliore valutazione non è la fascia meglio posizionata: 4.5-4.7 la supera di poco. Sotto 4.5 la differenza è di circa una posizione su venti, e il gruppo sotto-3.0 si posiziona meglio del gruppo 3.0-3.9, che è il tipo di inversione che vedi quando un effetto è per lo più rumore.
Un numero negativo significa che il valore più alto si trova più vicino alla posizione uno. Entrambi lo fanno, e il conteggio è circa sei volte il segnale più forte. Nessuno dei due è grande: anche il conteggio spiega solo una piccola percentuale della posizione di un'app, il che è un utile promemoria che la pertinenza, non la popolarità, fa la maggior parte del lavoro in un risultato di ricerca.
Il confondente, e cosa succede quando lo rimuovi
Le stelle e i conteggi delle valutazioni viaggiano insieme, quindi un confronto grezzo non può separarli. Nel nostro campione la fascia 4.5-4.7 ha una mediana di 13,507 valutazioni e la fascia 3.0-3.9 ha 72. Confrontare quei due gruppi è per lo più confrontare app grandi con app piccole.
Quindi abbiamo diviso gli stessi posizionamenti in fasce di conteggio delle valutazioni simili e abbiamo esaminato l'effetto delle stelle all'interno di ciascuna fascia, dove il confondente è in gran parte tenuto fermo.
Leggi una colonna e l'effetto della scala è ovvio: la stessa fascia di stelle si sposta da circa la posizione 12 a circa la posizione 9 man mano che il conteggio delle valutazioni cresce. Leggi una riga e l'effetto delle stelle è piccolo, incoerente, e nella fascia più piccola va all'indietro — le app valutate 4.8-5.0 con meno di 200 valutazioni si sono posizionate più in basso di qualsiasi gruppo nella tabella.
Quell'inversione non è misteriosa. Una media di 4.9 da 30 recensioni di solito appartiene a un'app molto piccola, ed essere molto piccola è ciò che si manifesta nella posizione. È una chiara dimostrazione del perché il gradiente grezzo non dovrebbe essere letto come un effetto delle stelle.
Un test più pulito: confronta all'interno di un singolo set di risultati
Confrontare un termine finanziario con un termine di un gioco di puzzle confronta due popolazioni diverse. Confrontare i primi tre con le posizioni 8-20 della stessa ricerca no. Abbiamo eseguito quel test appaiato sui 990 set di risultati con abbastanza app valutate a entrambe le estremità.
Le app in cima a un set di risultati sono valutate 0.023 stelle in più rispetto alle app in fondo. Hanno circa nove volte più valutazioni. Il gruppo con valutazione più alta ha occupato i primi tre in 52.6% dei set e il fondo in 22.8%, quindi la direzione è reale — è la dimensione che è trascurabile.
Cosa dice la letteratura
Questa non è una domanda nuova a livello accademico, e il lavoro pubblicato arriva in un posto simile. Sällberg, Wang e Numminen, scrivendo sul Journal of Marketing Analytics nel 2022, hanno seguito 341 app quotidianamente per circa due anni dal loro lancio sull'App Store e hanno separato le informazioni di valutazione dal testo delle recensioni. Per le app di produttività riportano che il punteggio medio di valutazione non aveva alcun effetto diretto significativo sui download, mentre il volume delle valutazioni sì. Per le app di gioco l'effetto del volume era negativo, il che è di per sé un avvertimento contro il trattare qualsiasi di questi come leve semplici.
Il lavoro sugli asset visivi punta nella stessa direzione sui limiti del pensiero a variabile singola: Wang e Li, in Electronic Commerce Research nel 2016, hanno estratto caratteristiche di colore, complessità e simmetria dalle icone Android e hanno trovato relazioni misurabili con il comportamento di download. Il campo più ampio del mining degli app store si è aperto con Harman, Jia e Zhang a MSR 2012, che ha stabilito che i metadati dello store possono essere analizzati su larga scala.
Cosa significa per la tua scheda
Limiti di questo studio
Una settimana, solo iOS, e i 3,564 termini che il nostro collector segue, che tendono verso le categorie in cui lavorano i nostri clienti piuttosto che un campione casuale dell'App Store. Il conteggio delle valutazioni è un'approssimazione della base di installazioni e rumorosa, poiché le app richiedono a tassi molto diversi. La posizione è osservazionale: non possiamo randomizzare la media delle stelle di un'app, quindi nulla qui è una stima causale. E una correlazione così piccola sarebbe sommersa da qualsiasi effetto di categoria che non abbiamo modellato.
Ciò che sopravvive a quei limiti è il confronto tra due segnali misurati allo stesso modo sugli stessi dati. Qualunque distorsione sia presente nel nostro campione si applica a entrambi, e il conteggio supera ancora il valore in stelle di circa sei a uno.
Cerca una parola chiave gratuitamente
Cerca una parola chiave gratuitamente
AsoTheory, come funzionano i punteggi
Correlati
- Tracker gratuito del ranking delle app: un flusso di lavoro pratico per piccoli team
- Dalla ricerca di parole chiave a un test della scheda
- alternative a data.ai per sviluppatori indie
- Le pagine prodotto personalizzate ora possono vincere traffico di ricerca organica sull'App Store. La maggior parte degli sviluppatori non l'ha attivato
Blog · Casi di studio · Free ASO tools · Prodotti · Privacy e termini · AsoTheory