Чи ранжуються додатки з рейтингом 4,8 зірки вище? Ми проаналізували 1000 пошуків в App Store
Apple називає рейтинги вхідними даними для ранжування, тому фольклор слідує: досягніть 4.8 і ви підніметесь. Ми взяли 1,000 наборів результатів, 18,796 окремих результатів пошуку, і подивилися. Значення зірок пояснює майже нічого. Кількість оцінок пояснює в шість разів більше.
Чому це питання варто ставити належним чином
Apple заявляє, що результати пошуку базуються на “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Це одне речення є джерелом величезної кількості порад щодо погоні за вищим середнім балом, зазвичай із 4.8 як порогом, який має значення.
Але “ratings and reviews” є неоднозначним саме в тому місці, яке має значення. Це може означати зіркове значення, або кількість людей, які його залишили, або обидва. Це різні речі, і вони передбачають зовсім різну роботу: підвищення середнього — це проблема продукту, а підвищення кількості — проблема розповсюдження.
Метод
Ми збираємо щоденні результати пошуку для термінів, які відстежують наші клієнти. Для цього дослідження ми взяли кожен окремий термін і країну, які колектор бачив за сім днів до 12 вересня 2026, кожен підрахований один раз за його останнім спостереженням, і залишили набори результатів, де принаймні вісім з топ-20 застосунків мали як зіркове значення, так і кількість оцінок у файлі. Це дає 1,000 наборів результатів і 18,796 окремих результатів пошуку.
Врахування кожного терміна один раз має значення. Той самий пошук у послідовні дні повертає майже ті самі застосунки в майже тому самому порядку, тому підрахунок його двічі подвоїв би вибірку без додавання будь-якої інформації та зробив би кожну цифру більш певною, ніж вона є.
Сира картина: майже пласка
Градієнт є, і він крихітний. Найкращий за рейтингом діапазон не є найкраще розміщеним: 4.5-4.7 випереджає його. Нижче 4.5 різниця становить приблизно одну позицію з двадцяти, а група з менш ніж 3.0 розміщується краще, ніж група 3.0-3.9, що є тим типом інверсії, який бачиш, коли ефект здебільшого шум.
Від'ємне число означає, що вище значення розташоване ближче до першої позиції. Обидва так і роблять, і кількість приблизно в шість разів сильніша за сигнал. Жодне не є великим: навіть кількість пояснює лише кілька відсотків того, де розташований застосунок, що є корисним нагадуванням, що релевантність, а не популярність, виконує більшу частину роботи в результатах пошуку.
Змішувальний фактор і що відбувається, коли його прибираєш
Зірки та кількість оцінок рухаються разом, тому сире порівняння не може їх розділити. У нашій вибірці діапазон 4.5-4.7 має медіану 13,507 оцінок, а діапазон 3.0-3.9 має 72. Порівняння цих двох груп — це здебільшого порівняння великих застосунків з малими.
Тож ми розділили ті самі позиції на діапазони подібної кількості оцінок і подивилися на зірковий ефект у кожному діапазоні, де змішувальний фактор значною мірою утримується нерухомим.
Прочитайте стовпець вниз, і ефект масштабу очевидний: той самий зірковий діапазон переміщується приблизно з позиції 12 до приблизно позиції 9 зі зростанням кількості оцінок. Прочитайте рядок упоперек, і зірковий ефект малий, непослідовний, а в найменшому діапазоні йде у зворотному напрямку — застосунки з рейтингом 4.8-5.0 з менш ніж 200 оцінками сиділи найнижче з будь-якої групи в таблиці.
Ця інверсія не є загадковою. Середнє 4.9 з 30 відгуків зазвичай належить дуже малому застосунку, і саме малість проявляється в позиції. Це чиста демонстрація того, чому сирий градієнт не слід читати як зірковий ефект.
Чистіший тест: порівняння в межах одного набору результатів
Порівняння фінансового терміна з терміном гри-головоломки порівнює дві різні популяції. Порівняння топ-трійки з позиціями 8-20 того самого пошуку — ні. Ми провели цей парний тест на 990 наборах результатів з достатньою кількістю оцінених застосунків на обох кінцях.
Застосунки на вершині набору результатів мають рейтинг на 0.023 зірок вищий, ніж застосунки внизу. Вони мають приблизно в дев'ять разів більше оцінок. Група з вищим рейтингом займала топ-трійку в 52.6% наборів і нижню в 22.8%, тому напрямок реальний — саме розмір є незначним.
Що говорить література
Це не нове питання в академічному плані, і опублікована робота приходить до подібного місця. Sällberg, Wang і Numminen, пишучи в Journal of Marketing Analytics у 2022, відстежували 341 застосунків щодня протягом приблизно двох років з моменту їхнього запуску в App Store і відокремили рейтингову інформацію від тексту відгуків. Для застосунків продуктивності вони повідомляють, що середній рейтинговий бал не мав значного прямого впливу на завантаження, тоді як обсяг рейтингів мав. Для ігрових застосунків ефект обсягу був негативним, що саме по собі є попередженням проти трактування будь-якого з цих як простих важелів.
Робота над візуальними активами вказує в тому ж напрямку щодо обмежень однозмінного мислення: Wang і Li, в Electronic Commerce Research у 2016, витягли колір, складність і симетрію з іконок Android і виявили вимірювані зв'язки з поведінкою завантаження. Ширша галузь аналізу магазинів застосунків відкрилася з Harman, Jia і Zhang на MSR 2012, які встановили, що метадані магазину можна аналізувати в масштабі взагалі.
Що це означає для вашого лістингу
Обмеження цього дослідження
Один тиждень, лише iOS, і 3,564 термінів, за якими стежить наш колектор, які схиляються до категорій, у яких працюють наші клієнти, а не до випадкової вибірки App Store. Кількість оцінок є проксі для бази встановлень і шумною, оскільки застосунки запитують з дуже різною частотою. Позиція є спостережуваною: ми не можемо рандомізувати зірковий середній бал застосунку, тому ніщо тут не є причинно-наслідковою оцінкою. І така мала кореляція була б перекрита будь-яким ефектом категорії, який ми не змоделювали.
Що переживає ці обмеження, так це порівняння між двома сигналами, виміряними однаковим способом на тих самих даних. Яке б упередження не було в нашій вибірці, воно застосовується до обох, і кількість все одно перевершує зіркове значення приблизно в шість разів.
Знайдіть ключове слово безкоштовно
Знайдіть ключове слово безкоштовно
Пов'язане
- Безкоштовний трекер позицій додатків: практичний робочий процес для малих команд
- Від дослідження ключових слів до тесту лістингу
- альтернативи data.ai для незалежних розробників
- Кастомні продуктові сторінки тепер можуть вигравати органічний пошуковий трафік App Store. Більшість розробників цього не ввімкнули
Блог · Кейси · Free ASO tools · Продукти · Конфіденційність та умови · AsoTheory