Ранжируются ли приложения с рейтингом 4,8 звезды выше? Мы проанализировали 1000 поисковых запросов в App Store

Apple называет рейтинги входным сигналом ранжирования, поэтому фольклор гласит: достигните 4.8 и подниметесь. Мы взяли 1000 наборов результатов, 18 796 отдельных результатов поиска и посмотрели. Значение звёзд почти ничего не объясняет. Количество оценок объясняет в шесть раз больше.

Почему этот вопрос стоит задавать правильно

Apple заявляет, что результаты поиска основаны на “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Это единственное предложение является источником огромного количества советов о погоне за более высоким средним рейтингом, обычно с 4.8 в качестве порога, который имеет значение.

Но “ratings and reviews” неоднозначно именно в том месте, которое имеет значение. Это может означать звездное значение, или количество людей, которые его оставили, или и то, и другое. Это разные вещи, и они подразумевают совершенно разную работу: повышение среднего — это проблема продукта, а повышение количества — проблема распространения.

Метод

Мы собираем ежедневные результаты поиска по терминам, которые отслеживают наши клиенты. Для этого исследования мы взяли каждый отдельный термин и страну, которые коллектор видел за семь дней до 12 сентября 2026, каждый учтен один раз по самому последнему наблюдению, и оставили наборы результатов, где по крайней мере восемь из топ-20 приложений имели и звездное значение, и количество оценок в файле. Это дает 1,000 наборов результатов и 18,796 отдельных результатов поиска.

Учет каждого термина один раз важен. Один и тот же поиск в последовательные дни возвращает почти одни и те же приложения почти в одном и том же порядке, поэтому учет его дважды удвоил бы выборку без добавления информации и сделал бы каждую цифру более достоверной, чем она есть.

Сырая картина: почти плоская

Градиент есть, и он крошечный. Группа с самым высоким рейтингом не является группой с лучшим размещением: 4.5-4.7 обходит ее. Ниже 4.5 разница составляет около одной позиции из двадцати, а группа с менее чем 3.0 размещается лучше, чем группа 3.0-3.9, что является типичной инверсией, когда эффект в основном шум.

Отрицательное число означает, что более высокое значение находится ближе к первой позиции. Оба так и делают, и количество примерно в шесть раз сильнее. Ни то, ни другое не велико: даже количество объясняет лишь несколько процентов того, где находится приложение, что является полезным напоминанием о том, что релевантность, а не популярность, делает основную работу в поисковой выдаче.

Смешивающий фактор и что происходит, когда вы его устраняете

Звезды и количество оценок идут вместе, поэтому сырое сравнение не может их разделить. В нашей выборке группа 4.5-4.7 имеет медиану 13,507 оценок, а группа 3.0-3.9 — 72. Сравнение этих двух групп — это в основном сравнение больших приложений с маленькими.

Поэтому мы разделили те же позиции на группы с похожим количеством оценок и посмотрели на эффект звезд внутри каждой группы, где смешивающий фактор в основном удерживается постоянным.

Прочитайте столбец, и эффект масштаба очевиден: одна и та же звездная группа перемещается примерно с позиции 12 на позицию 9 по мере роста количества оценок. Прочитайте строку, и эффект звезд мал, непоследователен, а в самой маленькой группе идет в обратную сторону — приложения с рейтингом 4.8-5.0 и менее чем 200 оценками занимали самое низкое положение среди всех групп в таблице.

Эта инверсия не загадочна. Среднее 4.9 из 30 отзывов обычно принадлежит очень маленькому приложению, и именно малый размер проявляется в позиции. Это чистая демонстрация того, почему сырой градиент не следует читать как эффект звезд.

Более чистый тест: сравнение внутри одного набора результатов

Сравнение финансового термина с термином игры-головоломки сравнивает две разные популяции. Сравнение первых трех с позициями 8-20 одного и того же поиска — нет. Мы провели этот парный тест на 990 наборах результатов с достаточным количеством оцененных приложений на обоих концах.

Приложения в верхней части набора результатов имеют рейтинг на 0.023 звезд выше, чем приложения в нижней части. У них примерно в девять раз больше оценок. Группа с более высоким рейтингом занимала первые три места в 52.6% наборов и нижние в 22.8%, так что направление реально — пренебрежимо мал именно размер.

Что говорит литература

Это не новый вопрос в академическом плане, и опубликованные работы приходят к похожему выводу. Sällberg, Wang и Numminen, пишущие в Journal of Marketing Analytics в 2022, отслеживали 341 приложений ежедневно в течение примерно двух лет с момента их запуска в App Store и отделили информацию о рейтинге от текста отзывов. Для приложений продуктивности они сообщают, что средний рейтинг не оказывал значимого прямого влияния на загрузки, в то время как объем оценок оказывал. Для игровых приложений эффект объема был отрицательным, что само по себе является предупреждением против рассмотрения любого из этих факторов как простых рычагов.

Работа над визуальными активами указывает в том же направлении относительно ограничений однопеременного мышления: Wang и Li в Electronic Commerce Research в 2016 извлекли цвет, сложность и симметрию из иконок Android и обнаружили измеримые связи с поведением при загрузке. Более широкая область анализа магазинов приложений началась с Harman, Jia и Zhang на MSR 2012, которые установили, что метаданные магазина можно анализировать в масштабе вообще.

Что это значит для вашего листинга

Ограничения этого исследования

Одна неделя, только iOS, и 3,564 терминов, за которыми следит наш коллектор, которые склоняются к категориям, в которых работают наши клиенты, а не к случайной выборке App Store. Количество оценок является прокси для базы установок и шумным, поскольку приложения запрашивают оценки с очень разной частотой. Позиция наблюдательная: мы не можем рандомизировать средний рейтинг приложения, так что здесь нет причинно-следственной оценки. И такая маленькая корреляция была бы подавлена любым эффектом категории, который мы не смоделировали.

Что переживает эти ограничения, так это сравнение двух сигналов, измеренных одинаково на одних и тех же данных. Какое бы смещение ни было в нашей выборке, оно применимо к обоим, и количество по-прежнему превосходит звездное значение примерно в шесть раз.

Посмотрите ключевое слово бесплатно

Посмотрите ключевое слово бесплатно

AsoTheory, как работают оценки

Похожие

Блог · Кейсы · Free ASO tools · Продукты · Конфиденциальность и условия · AsoTheory