4.8つ星の評価のアプリはランキングが高いのか?1,000件のApp Store検索を分析しました
Appleは評価をランキングの入力として挙げているので、フォークロアはこうなる:4.8になれば上昇する。私たちは1,000の結果セット、18,796の個別検索結果を取得して調べた。星の値はほとんど何も説明しない。評価の数は6倍以上説明する。
なぜこの質問をきちんと問う価値があるのか
Appleは、検索結果は“text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”に基づくと述べています。この一文が、より高い星平均を追い求める膨大なアドバイスの源であり、通常は4.8が重要な閾値として挙げられます。
しかし、“ratings and reviews”はまさに重要な箇所で曖昧です。星の値、または星を付けた人の数、あるいはその両方を意味する可能性があります。これらは異なるものであり、全く異なる作業を意味します。平均を上げることはプロダクトの問題であり、カウントを上げることは流通の問題です。
方法
私たちは顧客が追跡する用語の毎日の検索結果を収集しています。この調査では、コレクターが12年9月2026日までの7日間に見たすべての異なる用語と国を取得し、それぞれを最新の観測で1回だけ数え、上位20件のアプリのうち少なくとも8件が星の値と評価数の両方をファイルに持つ結果セットを保持しました。これにより、1,000件の結果セットと18,796件の個別の検索結果が得られます。
各用語を1回だけ取ることが重要です。同じ検索を連続した日に実行すると、ほぼ同じアプリがほぼ同じ順序で返されるため、2回数えると情報を追加せずにサンプルが2倍になり、すべての数値が実際よりも確実に見えてしまいます。
生の状況:ほぼ平坦
勾配はありますが、ごくわずかです。最高評価の帯域は最良の位置の帯域ではありません。4.5〜4.7がそれを上回ります。4.5未満では差は20位中約1位であり、3.0未満のグループは3.0〜3.9のグループよりも良い位置にあります。これは、効果がほとんどノイズであるときに見られる種類の逆転です。
負の数は、値が高いほど1位に近いことを意味します。どちらもそうであり、カウントは強い信号の約6倍です。どちらも大きくはありません。カウントでさえ、アプリの位置のわずか数パーセントしか説明できません。これは、検索結果では人気ではなく関連性が仕事の大部分を担っていることを思い出させてくれる有用な事実です。
交絡と、それを取り除いたときに何が起こるか
星と評価数は一緒に動くため、生の比較ではそれらを分離できません。私たちのサンプルでは、4.5〜4.7の帯域の評価数の中央値は13,507件で、3.0〜3.9の帯域は72件です。これら2つのグループを比較することは、主に大きなアプリと小さなアプリを比較することになります。
そこで、同じ掲載位置を類似した評価数の帯域に分割し、交絡がほぼ固定された各帯域内で星の効果を調べました。
列を下に読むと、スケールの効果は明らかです。同じ星の帯域は、評価数が増えるにつれて約12位から約9位へ移動します。行を横に読むと、星の効果は小さく、一貫性がなく、最小の帯域では逆方向に働きます。4.8〜5.0の評価で200件未満の評価数のアプリは、表のどのグループよりも低い位置にありました。
その逆転は不思議ではありません。30件のレビューからの4.9の平均は、通常非常に小さなアプリに属し、非常に小さいことが位置に現れます。これは、生の勾配を星の効果として読むべきではない理由の明確な実証です。
よりクリーンなテスト:1つの結果セット内で比較する
金融用語とパズルゲーム用語を比較することは、2つの異なる母集団を比較することになります。同じ検索の上位3件と8〜20位を比較することはそうではありません。両端に十分なスコア付きアプリがある990件の結果セットで、このペアテストを実施しました。
結果セットの上位にあるアプリは、下位にあるアプリよりも0.023星高く評価されています。評価数は約9倍です。高評価グループは52.6%のセットで上位3位を占め、22.8%で下位を占めたため、方向性は本物ですが、その大きさは無視できるほどです。
文献が述べていること
これは学術的には新しい問題ではなく、公表された研究も同様の結論に達しています。Sällberg、Wang、Numminenは、2022年にJournal of Marketing Analyticsに寄稿し、341個のアプリをApp Storeでのローンチから約2年間毎日追跡し、評価情報とレビューテキストを分離しました。生産性アプリについては、平均評価スコアはダウンロードに有意な直接効果を持たず、評価のボリュームは持つと報告しています。ゲームアプリではボリューム効果は負であり、これ自体がこれらのいずれかを単純なレバーとして扱うことへの警告です。
ビジュアルアセットに関する研究も、単一変数思考の限界について同じ方向を示しています。WangとLiは、2016年にElectronic Commerce Researchで、Androidアイコンから色、複雑さ、対称性の特徴を抽出し、ダウンロード行動との測定可能な関係を発見しました。アプリストアマイニングのより広い分野は、Harman、Jia、ZhangがMSR 2012で開拓し、ストアのメタデータが大規模に分析可能であることを確立しました。
これがあなたのリスティングにとって意味すること
この調査の限界
1週間、iOSのみ、そして私たちのコレクターが追跡する3,564件の用語は、App Storeのランダムサンプルではなく、顧客が活動するカテゴリに偏っています。評価数はインストールベースの代理指標であり、アプリによってプロンプトの頻度が大きく異なるためノイズが多いです。位置は観察データです。アプリの星平均をランダム化することはできないため、ここにあるものは因果推定ではありません。そして、これほど小さい相関は、モデル化していないカテゴリ効果によってかき消されてしまうでしょう。
これらの限界を生き残るのは、同じデータで同じ方法で測定された2つの信号の比較です。サンプルにどんなバイアスがあっても両方に適用され、カウントは依然として星の値を約6対1で上回ります。
関連
- 無料のアプリランクトラッカー:小規模チームのための実践的なワークフロー
- キーワードリサーチからリスティングテストまで
- インディー開発者向けdata.aiの代替案
- カスタムプロダクトページがオーガニックのApp Store検索トラフィックを獲得できるようになりました。ほとんどの開発者はまだ有効にしていません
ブログ · ケーススタディ · Free ASO tools · 製品 · プライバシーと利用規約 · AsoTheory