4.8 星評分的應用程式排名更高嗎?我們分析了 1,000 次 App Store 搜尋

Apple 將評分列為排名輸入,因此民間傳說隨之而來:達到 4.8 你就會上升。我們取了 1,000 個結果集、18,796 個個別搜尋結果,然後觀察。星級價值幾乎無法解釋任何東西。評分數量解釋力高出六倍。

為什麼這個問題值得好好問

Apple 聲明搜尋結果是基於 “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”。這單一句子是大量關於追求更高星級平均值的建議的起源,通常以 4.8 被指名為重要的門檻。

但 “ratings and reviews” 在關鍵的地方是模糊的。它可能指星級值,或留下星級的人數,或兩者皆是。這些是不同的東西,它們意味著完全不同的工作:提高平均值是產品問題,提高數量是分佈問題。

方法

我們每天收集客戶追蹤的詞的搜尋結果。對於這項研究,我們取了收集器在截至 12 年 9 月 2026 日的七天內看到的每個不同的詞和國家,每個詞在其最近的觀察中計算一次,並保留前 20 名中至少有八個 App 同時具有星級值和評分數量的結果集。這給出了 1,000 個結果集和 18,796 個單獨的搜尋結果。

每個詞只取一次很重要。同一搜尋在連續幾天返回幾乎相同的 App 和幾乎相同的順序,所以計算兩次會使樣本加倍而不增加任何資訊,並使每個數字看起來比實際更確定。

原始圖像:幾乎平坦

存在梯度,而且很小。評分最高的區間不是排名最好的區間:4.5-4.7 略勝一籌。低於 4.5 的差異約為二十個位置中的一個,而低於 3.0 的組比 3.0-3.9 組排名更好,這是在效應大多是雜訊時會看到的反轉類型。

負數表示較高的數值更接近第一名。兩者都是,而且次數大約是較強訊號的六倍。兩者都不大:即使是次數也只能解釋 App 位置的幾個百分點,這是一個有用的提醒,說明相關性而非受歡迎程度,在搜尋結果中做了大部分的工作。

混淆因素,以及移除它後會發生什麼

星級和評分數量一起變動,所以原始比較無法將它們分開。在我們的樣本中,4.5-4.7 區間的評分中位數為 13,507,而 3.0-3.9 區間為 72。比較這兩組主要是比較大型 App 與小型 App。

因此我們將相同的排名分成相似評分數量的區間,並在每個區間內查看星級效應,其中混淆因素大致被固定。

往下讀一欄,規模的效應很明顯:相同的星級區間隨著評分數量的增長,從大約位置 12 移動到大約位置 9。橫讀一列,星級效應很小、不一致,而且在最小的區間中反向——評分為 4.8-5.0 且評分低於 200 的 App 在表中任何組中排名最低。

這種反轉並不神秘。來自 30 則評論的 4.9 平均值通常屬於一個非常小的 App,而非常小正是位置中所顯示的。這清楚地展示了為什麼原始梯度不應被解讀為星級效應。

更乾淨的測試:在單一結果集內比較

比較一個金融詞和一個益智遊戲詞是比較兩個不同的族群。比較同一搜尋的前三名與位置 8-20 則不是。我們在 990 個兩端都有足夠評分 App 的結果集上進行了配對測試。

結果集頂部的 App 比底部的 App 評分高 0.023 顆星。它們的評分數量大約是九倍。評分較高的組在 52.6% 的集合中佔據前三名,在 22.8% 中佔據底部,所以方向是真實的——只是大小微不足道。

文獻怎麼說

這在學術上不是一個新問題,已發表的研究得出類似的結論。Sällberg、Wang 和 Numminen 在 2022 年的 Journal of Marketing Analytics 中寫道,他們追蹤了 341 個 App 從 App Store 發佈起每天約兩年,並將評分資訊與評論文字分開。對於生產力 App,他們報告平均評分對下載量沒有顯著的直接影響,而評分數量則有。對於遊戲 App,數量效應是負面的,這本身就是一個警告,不要將這些視為簡單的槓桿。

關於視覺資產的研究也指出了單一變數思維的局限性:Wang 和 Li 在 2016 年的 Electronic Commerce Research 中,從 Android 圖示中提取了顏色、複雜性和對稱性特徵,並發現與下載行為有可測量的關係。App Store 挖掘的更廣泛領域始於 Harman、Jia 和 Zhang 在 MSR 2012 的研究,該研究確立了商店元數據可以大規模分析。

這對你的列表意味著什麼

本研究的限制

僅一週,僅 iOS,以及 3,564 個我們的收集器追蹤的詞,這些詞傾向於我們客戶所在的類別,而不是 App Store 的隨機樣本。評分數量是安裝基礎的代理,而且是有雜訊的,因為 App 提示評分的頻率差異很大。位置是觀察性的:我們無法隨機化 App 的星級平均值,所以這裡沒有因果估計。而且這麼小的相關性會被我們未建模的任何類別效應淹沒。

在這些限制中倖存的是在同一數據上以相同方式測量的兩個訊號之間的比較。無論我們的樣本中存在什麼偏差,都適用於兩者,而數量仍然以大約六比一的優勢勝過星級值。

免費查詢關鍵字

免費查詢關鍵字

AsoTheory,分數如何運作

相關

部落格 · 案例研究 · Free ASO tools · 產品 · 隱私權與條款 · AsoTheory