Aplicațiile cu rating de 4,8 stele se clasează mai sus? Am analizat 1.000 de căutări în App Store
Apple numește evaluările ca factor de clasare, așa că folclorul urmează: ajungi la 4,8 și urci. Am luat 1.000 de seturi de rezultate, 18.796 de rezultate individuale de căutare și ne-am uitat. Valoarea stelelor nu explică aproape nimic. Numărul de evaluări explică de șase ori mai mult.
De ce merită examinată corect întrebarea
Apple spune că rezultatele se bazează pe “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Adică relevanța textului și comportamentul utilizatorilor. Acea propoziție a generat foarte multe sfaturi despre creșterea mediei stelelor, cu 4.8 numit frecvent pragul important.
Dar “ratings and reviews” este ambiguu exact unde contează. Poate însemna valoarea stelelor, numărul oamenilor care au evaluat sau ambele. Sunt lucruri diferite, cu muncă diferită: creșterea mediei este o problemă de produs, creșterea numărului o problemă de distribuție.
Metodă
Colectăm zilnic rezultate pentru termenii clienților. Am luat fiecare termen și țară distinctă din cele șapte zile până la 12 septembrie 2026, o dată la observația cea mai recentă, și am păstrat seturi unde cel puțin opt dintre primele 20 de aplicații aveau stele și număr înregistrat. Rezultă 1,000 de seturi și 18,796 de rezultate individuale.
Fiecare termen trebuie numărat o dată. Aceeași căutare în zile consecutive întoarce aproape aceleași aplicații în aceeași ordine. Numărarea de două ori dublează eșantionul fără informație nouă și face cifrele să pară mai sigure.
Imaginea brută: aproape plată
Există o pantă minusculă. Grupul cel mai bine evaluat nu este cel mai bine clasat: 4.5-4.7 îl depășește puțin. Sub 4.5 diferența este cam o poziție din douăzeci, iar grupul sub 3.0 este deasupra celui 3.0-3.9, o inversare tipică unui efect dominat de zgomot.
O valoare negativă înseamnă că valoarea mai mare se află mai aproape de primul loc. Ambele au această direcție, dar numărul evaluărilor este un semnal de aproximativ șase ori mai puternic. Niciunul nu este mare: chiar și numărul explică doar câteva procente din poziție. Relevanța, nu popularitatea, face cea mai mare parte a muncii în căutare.
Factorul de confuzie și eliminarea lui
Stelele și numărul merg împreună, deci comparația brută nu le separă. În eșantion, intervalul 4.5-4.7 are mediana 13,507 evaluări, iar 3.0-3.9 are 72. Comparăm în principal aplicații mari cu mici.
Am împărțit aceleași poziții în intervale cu numere similare de evaluări și am examinat efectul stelelor în interior, ținând factorul de confuzie aproximativ constant.
Pe coloană, efectul dimensiunii este evident: același interval de stele trece de la aproximativ poziția 12 la 9 când numărul crește. Pe rând, efectul stelelor este mic și inconsistent, iar în grupul cel mai mic se inversează: aplicațiile 4.8-5.0 cu sub 200 de evaluări erau cele mai jos din tabel.
Inversarea nu este misterioasă. Media 4.9 din 30 de recenzii aparține de obicei unei aplicații foarte mici, iar dimensiunea mică se vede în poziție. Arată de ce panta brută nu trebuie citită ca efect al stelelor.
Un test mai clar: compară în același set de rezultate
Compararea unui termen financiar cu unul pentru jocuri puzzle compară populații diferite. Compararea primelor trei cu pozițiile 8-20 ale aceleiași căutări nu face asta. Am aplicat testul pereche celor 990 de seturi cu suficiente aplicații evaluate la ambele capete.
Aplicațiile din vârf au cu 0.023 stele mai mult decât cele de jos. Au aproximativ de nouă ori mai multe evaluări. Grupul mai bine evaluat ocupa primele trei în 52.6% dintre seturi și partea de jos în 22.8%. Direcția este reală, dar dimensiunea neglijabilă.
Ce spune literatura
Întrebarea nu este nouă academic, iar studiile ajung similar. Sällberg, Wang și Numminen, în Journal of Marketing Analytics în 2022, au urmărit zilnic 341 de aplicații circa doi ani de la lansare și au separat evaluările de textul recenziilor. În productivitate media nu avea efect direct semnificativ asupra descărcărilor, dar volumul avea. În jocuri efectul volumului era negativ, avertizând împotriva unor pârghii simpliste.
Studiile vizuale arată și ele limitele gândirii cu o singură variabilă: Wang și Li, în Electronic Commerce Research în 2016, au extras culoare, complexitate și simetrie din pictograme Android și au găsit relații măsurabile cu descărcările. Domeniul mai larg al mineritului magazinelor a început cu Harman, Jia și Zhang la MSR 2012, arătând că metadatele pot fi analizate la scară.
Ce înseamnă pentru pagina ta
Limitele studiului
O săptămână, numai iOS și cei 3,564 de termeni urmăriți, concentrați spre categoriile clienților noștri, nu un eșantion aleatoriu App Store. Numărul evaluărilor este un indicator imperfect al instalărilor: aplicațiile solicită evaluări cu frecvențe foarte diferite. Poziția este observațională; nu putem randomiza media, deci nu estimăm cauzalitate. O corelație atât de mică ar fi depășită de un efect de categorie nemodelat.
Dincolo de limite, rămâne comparația a două semnale măsurate identic pe aceleași date. Orice bias afectează ambele, iar numărul rămâne de aproximativ șase ori mai puternic.
AsoTheory: cum funcționează scorurile
Asemănător
- Urmăritor gratuit de poziții pentru aplicații: un flux de lucru practic pentru echipe mici
- De la cercetarea cuvintelor cheie la un test de listare
- alternative data.ai pentru dezvoltatori independenți
- Paginile de produs personalizate pot câștiga acum trafic organic de căutare în App Store. Majoritatea dezvoltatorilor nu au activat acest lucru
Blog · Studii de caz · Free ASO tools · Produse · Confidențialitate și termeni · AsoTheory