क्या 4.8-स्टार रेटिंग वाले ऐप्स उच्च रैंक करते हैं? हमने 1,000 ऐप स्टोर खोजों का विश्लेषण किया

Apple रेटिंग को रैंकिंग इनपुट के रूप में नाम देता है, इसलिए लोककथा चलती है: 4.8 तक पहुंचें और आप चढ़ेंगे। हमने 1,000 परिणाम सेट, 18,796 व्यक्तिगत खोज परिणाम लिए, और देखा। स्टार मान लगभग कुछ भी स्पष्ट नहीं करता। रेटिंग की संख्या छह गुना अधिक स्पष्ट करती है।

प्रश्न को ठीक से पूछने लायक क्यों है

Apple कहता है कि खोज परिणाम “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)” पर आधारित हैं। यह एक वाक्य उच्च स्टार औसत का पीछा करने के बारे में भारी मात्रा में सलाह का मूल है, आमतौर पर 4.8 को उस सीमा के रूप में नामित किया जाता है जो मायने रखती है।

लेकिन “ratings and reviews” ठीक उसी जगह अस्पष्ट है जो मायने रखती है। इसका मतलब स्टार मान, या छोड़ने वाले लोगों की संख्या, या दोनों हो सकता है। वे अलग चीजें हैं और वे पूरी तरह से अलग काम का संकेत देते हैं: औसत बढ़ाना एक उत्पाद समस्या है, और गिनती बढ़ाना एक वितरण समस्या है।

विधि

हम अपने ग्राहकों द्वारा ट्रैक किए जाने वाले शब्दों के लिए दैनिक खोज परिणाम एकत्र करते हैं। इस अध्ययन के लिए हमने हर अलग शब्द और देश लिया जिसे कलेक्टर ने 12 सितंबर 2026 तक सात दिनों में देखा, प्रत्येक को उसके सबसे हाल के अवलोकन पर एक बार गिना, और उन परिणाम सेटों को रखा जहां शीर्ष 20 ऐप्स में से कम से कम आठ के पास फ़ाइल पर स्टार मान और रेटिंग गिनती दोनों थे। यह 1,000 परिणाम सेट और 18,796 व्यक्तिगत खोज परिणाम देता है।

प्रत्येक शब्द को एक बार लेना मायने रखता है। लगातार दिनों में एक ही खोज लगभग समान क्रम में लगभग समान ऐप्स लौटाती है, इसलिए इसे दो बार गिनने से बिना कोई जानकारी जोड़े नमूना दोगुना हो जाएगा और हर आंकड़ा वास्तव में जितना निश्चित है उससे अधिक निश्चित दिखाई देगा।

कच्ची तस्वीर: लगभग सपाट

एक ढाल है, और यह छोटा है। सबसे अच्छा-रेटेड बैंड सबसे अच्छा-स्थान वाला बैंड नहीं है: 4.5-4.7 इसे किनारे करता है। 4.5 से नीचे अंतर बीस में से लगभग एक स्थान है, और 3.0 से कम समूह 3.0-3.9 समूह से बेहतर स्थान पर है, जो उस तरह का उलटा है जो आप देखते हैं जब कोई प्रभाव अधिकतर शोर होता है।

ऋणात्मक संख्या का अर्थ है कि उच्च मान स्थिति एक के निकट है। दोनों ऐसा करते हैं, और गिनती लगभग छह गुना मजबूत संकेत है। कोई भी बड़ा नहीं है: यहां तक कि गिनती भी केवल कुछ प्रतिशत बताती है कि ऐप कहां बैठता है, जो एक उपयोगी अनुस्मारक है कि खोज परिणाम में प्रासंगिकता, लोकप्रियता नहीं, अधिकांश काम करती है।

भ्रम, और जब आप इसे हटाते हैं तो क्या होता है

सितारे और रेटिंग गिनती एक साथ चलते हैं, इसलिए एक कच्ची तुलना उन्हें अलग नहीं कर सकती। हमारे नमूने में 4.5-4.7 बैंड की माध्यिका 13,507 रेटिंग है और 3.0-3.9 बैंड की 72 है। उन दो समूहों की तुलना करना अधिकतर बड़े ऐप्स की छोटे ऐप्स से तुलना करना है।

इसलिए हमने समान प्लेसमेंट को समान रेटिंग गिनती के बैंड में विभाजित किया और प्रत्येक बैंड के भीतर स्टार प्रभाव को देखा, जहां भ्रम काफी हद तक स्थिर रहता है।

एक कॉलम नीचे पढ़ें और पैमाने का प्रभाव स्पष्ट है: वही स्टार बैंड रेटिंग गिनती बढ़ने पर लगभग स्थिति 12 से लगभग स्थिति 9 तक चलता है। एक पंक्ति में पढ़ें और स्टार प्रभाव छोटा, असंगत है, और सबसे छोटे बैंड में उल्टा चलता है — 4.8-5.0 रेटिंग वाले ऐप्स जिनकी रेटिंग 200 से कम है, तालिका में किसी भी समूह से सबसे नीचे बैठे।

वह उलटा रहस्यमय नहीं है। 30 समीक्षाओं से 4.9 औसत आमतौर पर एक बहुत छोटे ऐप का होता है, और बहुत छोटा होना ही स्थिति में दिखाई देता है। यह एक साफ प्रदर्शन है कि कच्चे ढाल को स्टार प्रभाव के रूप में क्यों नहीं पढ़ा जाना चाहिए।

एक स्वच्छ परीक्षण: एक ही परिणाम सेट के भीतर तुलना करें

वित्त शब्द की तुलना पहेली-खेल शब्द से करना दो अलग-अलग आबादी की तुलना करता है। एक ही खोज के शीर्ष तीन की तुलना स्थिति 8-20 से करना नहीं करता। हमने 990 परिणाम सेटों पर यह युग्मित परीक्षण चलाया जिनमें दोनों सिरों पर पर्याप्त स्कोर किए गए ऐप्स थे।

परिणाम सेट के शीर्ष पर ऐप्स उसके निचले भाग के ऐप्स की तुलना में 0.023 स्टार अधिक रेटेड हैं। उनके पास लगभग नौ गुना अधिक रेटिंग हैं। उच्च-रेटेड समूह ने 52.6% सेटों में शीर्ष तीन और 22.8% में निचला स्थान रखा, इसलिए दिशा वास्तविक है — यह आकार है जो नगण्य है।

साहित्य क्या कहता है

यह अकादमिक रूप से नया प्रश्न नहीं है, और प्रकाशित कार्य समान स्थान पर उतरता है। Sällberg, Wang और Numminen, 2022 में Journal of Marketing Analytics में लिखते हुए, 341 ऐप्स को उनके App Store लॉन्च से लगभग दो वर्षों तक दैनिक ट्रैक किया और रेटिंग जानकारी को समीक्षा पाठ से अलग किया। उत्पादकता ऐप्स के लिए वे रिपोर्ट करते हैं कि औसत रेटिंग स्कोर का डाउनलोड पर कोई महत्वपूर्ण प्रत्यक्ष प्रभाव नहीं था, जबकि रेटिंग की मात्रा का था। गेमिंग ऐप्स के लिए मात्रा प्रभाव नकारात्मक था, जो स्वयं इनमें से किसी को भी सरल लीवर के रूप में मानने के खिलाफ चेतावनी है।

दृश्य संपत्तियों पर काम एकल-चर सोच की सीमाओं के बारे में उसी दिशा में इंगित करता है: Wang और Li, 2016 में Electronic Commerce Research में, Android आइकन से रंग, जटिलता और समरूपता विशेषताएं निकालीं और डाउनलोड व्यवहार के साथ मापने योग्य संबंध पाए। ऐप स्टोर माइनिंग का व्यापक क्षेत्र Harman, Jia और Zhang के साथ MSR 2012 में खुला, जिसने स्थापित किया कि स्टोर मेटाडेटा का बड़े पैमाने पर विश्लेषण किया जा सकता है।

आपकी लिस्टिंग के लिए इसका क्या अर्थ है

इस अध्ययन की सीमाएं

एक सप्ताह, केवल iOS, और 3,564 शब्द जिन्हें हमारा कलेक्टर फॉलो करता है, जो App Store के यादृच्छिक नमूने के बजाय हमारे ग्राहकों की श्रेणियों की ओर झुकते हैं। रेटिंग गिनती इंस्टॉल बेस के लिए एक प्रॉक्सी है और शोर वाली है, क्योंकि ऐप्स बहुत अलग दरों पर संकेत देते हैं। स्थिति अवलोकनात्मक है: हम किसी ऐप के स्टार औसत को यादृच्छिक नहीं कर सकते, इसलिए यहां कुछ भी कारणात्मक अनुमान नहीं है। और इतना छोटा सहसंबंध किसी भी श्रेणी प्रभाव से दब जाएगा जिसे हमने मॉडल नहीं किया है।

उन सीमाओं से जो बचता है वह दो संकेतों के बीच की तुलना है जिन्हें एक ही डेटा पर एक ही तरह से मापा जाता है। हमारे नमूने में जो भी पूर्वाग्रह बैठता है वह दोनों पर लागू होता है, और गिनती अभी भी स्टार मान से लगभग छह से एक बेहतर प्रदर्शन करती है।

मुफ्त में एक कीवर्ड देखें

मुफ्त में एक कीवर्ड देखें

AsoTheory, स्कोर कैसे काम करते हैं

संबंधित

ब्लॉग · केस स्टडीज़ · Free ASO tools · उत्पाद · गोपनीयता और शर्तें · AsoTheory