האם אפליקציות עם דירוג 4.8 כוכבים מדורגות גבוה יותר? ניתחנו 1,000 חיפושים ב-App Store
אפל מציינת דירוגים כקלט לדירוג, אז הפולקלור עוקב: הגיע ל-4.8 ותעלה. לקחנו 1,000 קבוצות תוצאות, 18,796 תוצאות חיפוש בודדות, והסתכלנו. ערך הכוכב מסביר כמעט כלום. מספר הדירוגים מסביר פי שישה יותר.
למה כדאי לשאול את השאלה כמו שצריך
אפל מצהירה שתוצאות החיפוש מבוססות על “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. המשפט היחיד הזה הוא המקור לכמות עצומה של עצות לגבי רדיפה אחר ממוצע כוכבים גבוה יותר, בדרך כלל עם 4.8 כסף שחשוב.
אבל “ratings and reviews” הוא דו-משמעי בדיוק במקום שחשוב. זה יכול להיות ערך הכוכבים, או מספר האנשים שהשאירו אחד, או שניהם. אלה דברים שונים והם מרמזים על עבודה שונה לחלוטין: העלאת ממוצע היא בעיית מוצר, והעלאת ספירה היא בעיית הפצה.
שיטה
אנחנו אוספים תוצאות חיפוש יומיות עבור המונחים שהלקוחות שלנו עוקבים אחריהם. למחקר הזה לקחנו כל מונח ומדינה נפרדים שהאספן ראה בשבעת הימים עד 12 בספטמבר 2026, כל אחד נספר פעם אחת בתצפית האחרונה שלו, ושמרנו קבוצות תוצאות שבהן לפחות שמונה מה-20 האפליקציות הראשונות היו עם ערך כוכבים וספירת דירוג בתיק. זה נותן 1,000 קבוצות תוצאות ו-18,796 תוצאות חיפוש בודדות.
לקיחת כל מונח פעם אחת חשובה. אותו חיפוש בימים רצופים מחזיר כמעט את אותן אפליקציות כמעט באותו סדר, כך שספירתו פעמיים תכפיל את המדגם בלי להוסיף מידע ותגרום לכל נתון להיראות ודאי יותר ממה שהוא.
התמונה הגולמית: כמעט שטוחה
יש שיפוע, והוא זעיר. הרצועה המדורגת הכי גבוה אינה הרצועה שממוקמת הכי טוב: 4.5-4.7 עוקפת אותה. מתחת ל-4.5 ההבדל הוא בערך מיקום אחד מתוך עשרים, והקבוצה מתחת ל-3.0 ממוקמת טוב יותר מקבוצת 3.0-3.9, שזה סוג ההיפוך שרואים כשאפקט הוא בעיקר רעש.
מספר שלילי פירושו שהערך הגבוה יותר קרוב יותר למקום הראשון. שניהם כך, והספירה חזקה בערך פי שישה מהאות. אף אחד מהם אינו גדול: אפילו הספירה מסבירה רק אחוזים בודדים מהמיקום של אפליקציה, וזו תזכורת שימושית לכך שרלוונטיות, לא פופולריות, עושה את רוב העבודה בתוצאת חיפוש.
המבלבל, ומה קורה כשמסירים אותו
כוכבים וספירות דירוג נעים יחד, כך שהשוואה גולמית לא יכולה להפריד ביניהם. במדגם שלנו לרצועת 4.5-4.7 יש חציון של 13,507 דירוגים ולרצועת 3.0-3.9 יש 72. השוואת שתי הקבוצות האלה היא בעיקר השוואת אפליקציות גדולות עם קטנות.
אז פיצלנו את אותם מיקומים לרצועות של ספירת דירוג דומה והסתכלנו על אפקט הכוכבים בתוך כל רצועה, שם המבלבל מוחזק ברובו קבוע.
קראו עמודה למטה והאפקט של קנה מידה ברור: אותה רצועת כוכבים נעה ממיקום 12 בערך למיקום 9 בערך ככל שספירת הדירוג גדלה. קראו שורה לרוחב ואפקט הכוכבים קטן, לא עקבי, וברצועה הקטנה ביותר רץ אחורה — אפליקציות בדירוג 4.8-5.0 עם פחות מ-200 דירוגים ישבו הכי נמוך מכל קבוצה בטבלה.
ההיפוך הזה אינו מסתורי. ממוצע 4.9 מ-30 ביקורות שייך בדרך כלל לאפליקציה קטנה מאוד, ולהיות קטנה מאוד זה מה שמופיע במיקום. זו הדגמה נקייה למה אין לקרוא את השיפוע הגולמי כאפקט כוכבים.
בדיקה נקייה יותר: השוואה בתוך קבוצת תוצאות אחת
השוואת מונח פיננסי מול מונח משחק-פאזל משווה שתי אוכלוסיות שונות. השוואת השלושה הראשונים מול מיקומים 8-20 של אותו חיפוש לא. הרצנו את הבדיקה המזווגת הזו על 990 קבוצות התוצאות עם מספיק אפליקציות מדורגות בשני הקצוות.
האפליקציות בראש קבוצת תוצאות מדורגות ב-0.023 כוכבים גבוה יותר מהאפליקציות בתחתיתה. יש להן בערך פי תשעה דירוגים. הקבוצה המדורגת גבוה יותר החזיקה את השלושה הראשונים ב-52.6% מהקבוצות ואת התחתית ב-22.8%, כך שהכיוון אמיתי — הגודל הוא שזניח.
מה שהספרות אומרת
זו לא שאלה חדשה מבחינה אקדמית, והעבודה שפורסמה נוחתת במקום דומה. Sällberg, Wang ו-Numminen, שכתבו ב-Journal of Marketing Analytics ב-2022, עקבו אחרי 341 אפליקציות מדי יום במשך כשנתיים מהשקתן ב-App Store והפרידו מידע דירוג מטקסט ביקורת. עבור אפליקציות פרודוקטיביות הם מדווחים שלציון הדירוג הממוצע אין השפעה ישירה משמעותית על הורדות, בעוד שלנפח הדירוגים יש. עבור אפליקציות משחק אפקט הנפח היה שלילי, שזו עצמה אזהרה נגד התייחסות לכל אלה כמנופים פשוטים.
עבודה על נכסים חזותיים מצביעה באותו כיוון לגבי מגבלות החשיבה החד-משתנית: Wang ו-Li, ב-Electronic Commerce Research ב-2016, חילצו תכונות צבע, מורכבות וסימטריה מאייקוני אנדרואיד ומצאו קשרים מדידים עם התנהגות הורדה. התחום הרחב יותר של כריית חנויות אפליקציות נפתח עם Harman, Jia ו-Zhang ב-MSR 2012, שקבע שניתן לנתח מטא-נתונים של חנות בקנה מידה בכלל.
מה זה אומר עבור הרישום שלך
מגבלות המחקר הזה
שבוע אחד, iOS בלבד, וה-3,564 מונחים שהאספן שלנו עוקב אחריהם, שנוטים לקטגוריות שבהן הלקוחות שלנו עובדים ולא מדגם אקראי של ה-App Store. ספירת דירוג היא proxy לבסיס התקנות ורועשת, מכיוון שאפליקציות מבקשות דירוג בקצבים שונים מאוד. מיקום הוא תצפיתי: אנחנו לא יכולים להקצות אקראית את ממוצע הכוכבים של אפליקציה, כך ששום דבר כאן אינו הערכה סיבתית. ומתאם קטן כזה ייבלע על ידי כל אפקט קטגוריה שלא דגמנו.
מה ששורד את המגבלות האלה הוא ההשוואה בין שני אותות שנמדדו באותה דרך על אותם נתונים. כל הטיה שיושבת במדגם שלנו חלה על שניהם, והספירה עדיין עולה על ערך הכוכבים בערך פי שישה.
קשור
- מעקב דירוג אפליקציות חינמי: זרימת עבודה מעשית לצוותים קטנים
- ממחקר מילות מפתח לבדיקת רישום
- חלופות data.ai למפתחי אינדי
- דפי מוצר מותאמים אישית יכולים כעת לזכות בתנועת חיפוש אורגנית ב-App Store. רוב המפתחים עדיין לא הפעילו זאת
בלוג · מקרי בוחן · Free ASO tools · מוצרים · פרטיות ותנאים · AsoTheory