Les applications avec une note de 4,8 étoiles sont-elles mieux classées ? Nous avons analysé 1 000 recherches sur l'App Store

Apple cite les évaluations comme un facteur de classement, donc le folklore suit : atteignez 4,8 et vous grimpez. Nous avons pris 1 000 ensembles de résultats, 18 796 résultats de recherche individuels, et avons regardé. La valeur en étoiles n'explique presque rien. Le nombre d'évaluations explique six fois plus.

Pourquoi la question mérite d'être posée correctement

Apple déclare que les résultats de recherche sont basés sur “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Cette seule phrase est à l'origine d'une énorme quantité de conseils sur la poursuite d'une moyenne d'étoiles plus élevée, généralement avec 4.8 cité comme le seuil qui compte.

Mais “ratings and reviews” est ambigu exactement là où cela compte. Cela pourrait signifier la valeur en étoiles, ou le nombre de personnes qui en ont laissé une, ou les deux. Ce sont des choses différentes et elles impliquent un travail complètement différent : augmenter une moyenne est un problème de produit, et augmenter un compte est un problème de distribution.

Méthode

Nous collectons quotidiennement les résultats de recherche pour les termes que nos clients suivent. Pour cette étude, nous avons pris chaque terme et pays distinct que le collecteur a vus au cours des sept jours jusqu'au 12 septembre 2026, chacun compté une fois à son observation la plus récente, et conservé les ensembles de résultats où au moins huit des top 20 apps avaient à la fois une valeur en étoiles et un nombre d'évaluations enregistrés. Cela donne 1,000 ensembles de résultats et 18,796 résultats de recherche individuels.

Prendre chaque terme une fois compte. La même recherche sur des jours consécutifs renvoie presque les mêmes apps dans presque le même ordre, donc la compter deux fois doublerait l'échantillon sans ajouter d'information et rendrait chaque chiffre plus certain qu'il ne l'est.

Le tableau brut : presque plat

Il y a un gradient, et il est minuscule. La bande la mieux notée n'est pas la bande la mieux placée : 4.5-4.7 la devance. En dessous de 4.5, la différence est d'environ une position sur vingt, et le groupe sous 3.0 se place mieux que le groupe 3.0-3.9, ce qui est le genre d'inversion que l'on voit quand un effet est surtout du bruit.

Un nombre négatif signifie que la valeur la plus élevée se situe plus près de la première position. Les deux le font, et le compte est environ six fois le signal le plus fort. Ni l'un ni l'autre n'est important : même le compte n'explique que quelques pour cent de la position d'une app, ce qui est un rappel utile que la pertinence, et non la popularité, fait l'essentiel du travail dans un résultat de recherche.

Le facteur de confusion, et ce qui se passe quand on le supprime

Les étoiles et les nombres d'évaluations vont de pair, donc une comparaison brute ne peut pas les séparer. Dans notre échantillon, la bande 4.5-4.7 a une médiane de 13,507 évaluations et la bande 3.0-3.9 a 72. Comparer ces deux groupes revient principalement à comparer de grandes apps avec de petites.

Nous avons donc divisé les mêmes placements en bandes de nombre d'évaluations similaires et examiné l'effet des étoiles à l'intérieur de chaque bande, où le facteur de confusion est largement maintenu fixe.

Lisez une colonne et l'effet de l'échelle est évident : la même bande d'étoiles passe d'environ la position 12 à environ la position 9 à mesure que le nombre d'évaluations augmente. Lisez une ligne et l'effet des étoiles est faible, incohérent, et dans la plus petite bande, il va à l'envers — les apps notées 4.8-5.0 avec moins de 200 évaluations se sont classées le plus bas de tous les groupes du tableau.

Cette inversion n'est pas mystérieuse. Une moyenne de 4.9 à partir de 30 avis appartient généralement à une très petite app, et être très petite est ce qui se manifeste dans la position. C'est une démonstration claire de pourquoi le gradient brut ne doit pas être lu comme un effet des étoiles.

Un test plus propre : comparer au sein d'un même ensemble de résultats

Comparer un terme financier à un terme de jeu de puzzle compare deux populations différentes. Comparer les trois premiers aux positions 8-20 de la même recherche ne le fait pas. Nous avons exécuté ce test apparié sur les 990 ensembles de résultats avec suffisamment d'apps notées aux deux extrémités.

Les apps en haut d'un ensemble de résultats sont notées 0.023 étoiles de plus que les apps en bas. Elles ont environ neuf fois plus d'évaluations. Le groupe le mieux noté a occupé le top trois dans 52.6% des ensembles et le bas dans 22.8%, donc la direction est réelle — c'est la taille qui est négligeable.

Ce que dit la littérature

Ce n'est pas une question nouvelle sur le plan académique, et les travaux publiés aboutissent à un endroit similaire. Sällberg, Wang et Numminen, écrivant dans le Journal of Marketing Analytics en 2022, ont suivi 341 apps quotidiennement pendant environ deux ans depuis leur lancement sur l'App Store et ont séparé les informations de notation du texte des avis. Pour les apps de productivité, ils rapportent que le score de note moyen n'avait aucun effet direct significatif sur les téléchargements, tandis que le volume d'évaluations en avait un. Pour les apps de jeu, l'effet du volume était négatif, ce qui est en soi un avertissement contre le traitement de l'un de ces éléments comme de simples leviers.

Les travaux sur les éléments visuels pointent dans la même direction concernant les limites de la pensée à variable unique : Wang et Li, dans Electronic Commerce Research en 2016, ont extrait les caractéristiques de couleur, de complexité et de symétrie des icônes Android et ont trouvé des relations mesurables avec le comportement de téléchargement. Le domaine plus large de l'exploration de l'App Store a débuté avec Harman, Jia et Zhang à MSR 2012, qui a établi que les métadonnées de la boutique peuvent être analysées à grande échelle.

Ce que cela signifie pour votre fiche

Limites de cette étude

Une semaine, iOS uniquement, et les 3,564 termes que notre collecteur suit, qui penchent vers les catégories dans lesquelles nos clients travaillent plutôt qu'un échantillon aléatoire de l'App Store. Le nombre d'évaluations est un proxy de la base d'installations et un proxy bruyant, car les apps sollicitent à des rythmes très différents. La position est observationnelle : nous ne pouvons pas randomiser la moyenne d'étoiles d'une app, donc rien ici n'est une estimation causale. Et une corrélation aussi faible serait submergée par tout effet de catégorie que nous n'avons pas modélisé.

Ce qui survit à ces limites est la comparaison entre deux signaux mesurés de la même manière sur les mêmes données. Quel que soit le biais présent dans notre échantillon, il s'applique aux deux, et le compte surpasse toujours la valeur en étoiles par environ six contre un.

Recherchez un mot-clé gratuitement

Recherchez un mot-clé gratuitement

AsoTheory, comment fonctionnent les scores

Connexe

Blog · Études de cas · Free ASO tools · Produits · Confidentialité et conditions · AsoTheory