Umisťují se aplikace s hodnocením 4,8 hvězdičky výše? Analyzovali jsme 1 000 vyhledávání v App Store
Apple uvádí hodnocení jako vstup pro umístění, takže folklór následuje: dostaňte se na 4,8 a stoupáte. Vzali jsme 1 000 sad výsledků, 18 796 jednotlivých výsledků vyhledávání a podívali se. Hodnota hvězdiček nevysvětluje téměř nic. Počet hodnocení vysvětluje šestkrát více.
Proč stojí za to položit otázku pořádně
Apple uvádí, že výsledky vyhledávání jsou založeny na “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Tato jediná věta je původem obrovského množství rad o honbě za vyšším průměrem hvězd, obvykle s 4.8 označeným jako práh, na kterém záleží.
Ale “ratings and reviews” je nejednoznačné přesně v místě, na kterém záleží. Může znamenat hodnotu hvězd, nebo počet lidí, kteří ji zanechali, nebo obojí. To jsou různé věci a naznačují úplně jinou práci: zvýšení průměru je produktový problém a zvýšení počtu je distribuční problém.
Metoda
Sbíráme denně výsledky vyhledávání pro termíny, které naši zákazníci sledují. Pro tuto studii jsme vzali každý odlišný termín a zemi, které kolektor viděl v sedmi dnech do 12. září 2026, každý započítán jednou při svém nejnovějším pozorování, a ponechali sady výsledků, kde alespoň osm z prvních 20 aplikací mělo v evidenci jak hodnotu hvězd, tak počet hodnocení. To dává 1,000 sad výsledků a 18,796 jednotlivých výsledků vyhledávání.
Započítat každý termín jednou záleží. Stejné vyhledávání v po sobě jdoucích dnech vrací téměř stejné aplikace v téměř stejném pořadí, takže započítání dvakrát by zdvojnásobilo vzorek bez přidání jakékoli informace a každý údaj by vypadal jistější, než je.
Hrubý obrázek: téměř plochý
Existuje gradient a je nepatrný. Nejlépe hodnocené pásmo není nejlépe umístěné pásmo: 4.5–4.7 ho předčí. Pod 4.5 je rozdíl asi jedna pozice z dvaceti a skupina pod 3.0 se umisťuje lépe než skupina 3.0–3.9, což je druh inverze, který vidíš, když je efekt většinou šum.
Záporné číslo znamená, že vyšší hodnota sedí blíže pozici jedna. Obě to dělají a počet je zhruba šestkrát silnější signál. Ani jeden není velký: dokonce i počet vysvětluje jen několik procent toho, kde se aplikace nachází, což je užitečná připomínka, že relevanci, nikoli popularitě, patří většina práce ve výsledku vyhledávání.
Matoucí faktor a co se stane, když ho odstraníš
Hvězdy a počty hodnocení cestují společně, takže hrubé srovnání je nemůže oddělit. V našem vzorku má pásmo 4.5–4.7 medián 13,507 hodnocení a pásmo 3.0–3.9 má 72. Porovnání těchto dvou skupin je většinou porovnání velkých aplikací s malými.
Takže jsme rozdělili stejná umístění do pásem podobného počtu hodnocení a podívali se na efekt hvězd uvnitř každého pásma, kde je matoucí faktor z velké části držen v klidu.
Čti sloupec dolů a efekt měřítka je zřejmý: stejné hvězdové pásmo se posouvá z přibližně pozice 12 na přibližně pozici 9, jak počet hodnocení roste. Čti řádek napříč a efekt hvězd je malý, nekonzistentní a v nejmenším pásmu běží pozpátku — aplikace hodnocené 4.8–5.0 s méně než 200 hodnoceními seděly nejníže ze všech skupin v tabulce.
Tato inverze není záhadná. Průměr 4.9 z 30 recenzí obvykle patří velmi malé aplikaci a být velmi malý je to, co se projevuje v pozici. Je to čistá ukázka toho, proč by hrubý gradient neměl být čten jako efekt hvězd.
Čistší test: porovnání v rámci jedné sady výsledků
Porovnání finančního termínu s termínem logické hry porovnává dvě různé populace. Porovnání prvních tří proti pozicím 8–20 stejného vyhledávání ne. Spustili jsme tento párový test na 990 sadách výsledků s dostatkem hodnocených aplikací na obou koncích.
Aplikace na vrcholu sady výsledků jsou hodnoceny o 0.023 hvězd výše než aplikace na jejím dně. Mají zhruba devětkrát více hodnocení. Skupina s vyšším hodnocením držela první tři v 52.6% sad a dno v 22.8%, takže směr je skutečný — je to velikost, která je zanedbatelná.
Co říká literatura
Toto není akademicky nová otázka a publikovaná práce přistává na podobném místě. Sällberg, Wang a Numminen, píšící v Journal of Marketing Analytics v 2022, sledovali 341 aplikací denně asi dva roky od jejich spuštění v App Store a oddělili informace o hodnocení od textu recenzí. U produktivních aplikací uvádějí, že průměrné hodnocení nemělo žádný významný přímý efekt na stažení, zatímco objem hodnocení ano. U herních aplikací byl efekt objemu negativní, což je samo o sobě varováním před zacházením s kterýmkoli z nich jako s jednoduchými pákami.
Práce na vizuálních prvcích ukazuje stejným směrem o limitech myšlení s jednou proměnnou: Wang a Li v Electronic Commerce Research v 2016 extrahovali barvu, složitost a symetrii z ikon Androidu a našli měřitelné vztahy s chováním při stahování. Širší pole dolování obchodů s aplikacemi otevřeli Harman, Jia a Zhang na MSR 2012, kteří ukázali, že metadata obchodu lze analyzovat ve velkém měřítku vůbec.
Co to znamená pro tvůj listing
Limity této studie
Jeden týden, pouze iOS, a 3,564 termínů, které náš kolektor sleduje, které se přiklánějí ke kategoriím, v nichž pracují naši zákazníci, spíše než k náhodnému vzorku App Store. Počet hodnocení je zástupný ukazatel instalační základny a je zašuměný, protože aplikace vyzývají velmi rozdílnou rychlostí. Pozice je observační: nemůžeme randomizovat hvězdový průměr aplikace, takže nic zde není kauzální odhad. A takto malá korelace by byla přehlušena jakýmkoli kategoriálním efektem, který jsme nemodelovali.
Co přežije tyto limity, je srovnání mezi dvěma signály měřenými stejným způsobem na stejných datech. Ať už je v našem vzorku jakékoli zkreslení, platí pro oba, a počet stále překonává hodnotu hvězd zhruba šest ku jedné.
Související
- Bezplatný sledovač pozic aplikací: praktický pracovní postup pro malé týmy
- Od výzkumu klíčových slov k testu zápisu
- alternativy data.ai pro nezávislé vývojáře
- Vlastní produktové stránky nyní mohou získávat organickou návštěvnost z vyhledávání v App Store. Většina vývojářů to nezapnula
Blog · Případové studie · Free ASO tools · Produkty · Soukromí a podmínky · AsoTheory