Apps com classificação de 4,8 estrelas ranqueiam mais alto? Analisamos 1.000 buscas na App Store
A Apple cita avaliações como um insumo de classificação, então o folclore segue: chegue a 4,8 e você sobe. Pegamos 1.000 conjuntos de resultados, 18.796 resultados de busca individuais e olhamos. O valor da estrela explica quase nada. O número de avaliações explica seis vezes mais.
Por que vale a pena fazer a pergunta corretamente
A Apple afirma que os resultados de busca são baseados em “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Essa única frase é a origem de uma quantidade enorme de conselhos sobre perseguir uma média de estrelas mais alta, geralmente com 4.8 citado como o limite que importa.
Mas “ratings and reviews” é ambíguo exatamente no lugar que importa. Pode significar o valor em estrelas, ou o número de pessoas que deixaram uma, ou ambos. São coisas diferentes e implicam trabalhos completamente diferentes: aumentar uma média é um problema de produto, e aumentar uma contagem é um problema de distribuição.
Método
Coletamos resultados de busca diários para os termos que nossos clientes rastreiam. Para este estudo pegamos cada termo e país distintos que o coletor viu nos sete dias até 12 de setembro de 2026, cada um contado uma vez na sua observação mais recente, e mantivemos conjuntos de resultados onde pelo menos oito dos 20 principais apps tinham tanto um valor em estrelas quanto uma contagem de avaliações em arquivo. Isso dá 1,000 conjuntos de resultados e 18,796 resultados de busca individuais.
Tomar cada termo uma vez importa. A mesma busca em dias consecutivos retorna quase os mesmos apps em quase a mesma ordem, então contá-la duas vezes dobraria a amostra sem adicionar nenhuma informação e faria cada número parecer mais certo do que é.
O quadro bruto: quase plano
Há um gradiente, e ele é minúsculo. A faixa mais bem avaliada não é a faixa mais bem colocada: 4.5-4.7 a supera. Abaixo de 4.5 a diferença é cerca de uma posição em vinte, e o grupo abaixo de 3.0 coloca melhor do que o grupo 3.0-3.9, que é o tipo de inversão que você vê quando um efeito é principalmente ruído.
Um número negativo significa que o valor mais alto fica mais próximo da posição um. Ambos ficam, e a contagem é aproximadamente seis vezes o sinal mais forte. Nenhum é grande: até a contagem explica apenas alguns por cento de onde um app fica, o que é um lembrete útil de que a relevância, não a popularidade, faz a maior parte do trabalho em um resultado de busca.
O confundidor, e o que acontece quando você o remove
Estrelas e contagens de avaliações viajam juntas, então uma comparação bruta não pode separá-las. Em nossa amostra a faixa 4.5-4.7 tem uma mediana de 13,507 avaliações e a faixa 3.0-3.9 tem 72. Comparar esses dois grupos é principalmente comparar apps grandes com pequenos.
Então dividimos as mesmas colocações em faixas de contagem de avaliações semelhante e olhamos o efeito das estrelas dentro de cada faixa, onde o confundidor é amplamente mantido parado.
Leia uma coluna para baixo e o efeito da escala é óbvio: a mesma faixa de estrelas se move de cerca da posição 12 para cerca da posição 9 conforme a contagem de avaliações cresce. Leia uma linha transversalmente e o efeito das estrelas é pequeno, inconsistente, e na menor faixa corre ao contrário — apps avaliados com 4.8-5.0 com menos de 200 avaliações ficaram mais baixos de qualquer grupo na tabela.
Essa inversão não é misteriosa. Uma média 4.9 de 30 avaliações geralmente pertence a um app muito pequeno, e ser muito pequeno é o que aparece na posição. É uma demonstração limpa de por que o gradiente bruto não deve ser lido como um efeito de estrelas.
Um teste mais limpo: compare dentro de um único conjunto de resultados
Comparar um termo de finanças com um termo de jogo de quebra-cabeça compara duas populações diferentes. Comparar os três primeiros contra as posições 8-20 da mesma busca não. Rodamos esse teste pareado nos 990 conjuntos de resultados com apps pontuados suficientes em ambas as extremidades.
Os apps no topo de um conjunto de resultados são avaliados 0.023 estrelas mais alto do que os apps no fundo dele. Eles têm aproximadamente nove vezes mais avaliações. O grupo mais bem avaliado ficou com o topo três em 52.6% dos conjuntos e o fundo em 22.8%, então a direção é real — é o tamanho que é insignificante.
O que a literatura diz
Esta não é uma pergunta nova academicamente, e o trabalho publicado chega a um lugar semelhante. Sällberg, Wang e Numminen, escrevendo no Journal of Marketing Analytics em 2022, acompanharam 341 apps diariamente por cerca de dois anos desde o lançamento na App Store e separaram a informação de avaliação do texto de review. Para apps de produtividade eles relatam que a pontuação média de avaliação não teve efeito direto significativo sobre downloads, enquanto o volume de avaliações teve. Para apps de jogos o efeito do volume foi negativo, o que é em si um aviso contra tratar qualquer um desses como alavancas simples.
Trabalhos sobre ativos visuais apontam na mesma direção sobre os limites do pensamento de variável única: Wang e Li, na Electronic Commerce Research em 2016, extraíram características de cor, complexidade e simetria de ícones Android e encontraram relações mensuráveis com o comportamento de download. O campo mais amplo de mineração de lojas de apps abriu com Harman, Jia e Zhang na MSR 2012, que estabeleceu que metadados de loja podem ser analisados em escala.
O que isso significa para sua listagem
Limites deste estudo
Uma semana, apenas iOS, e os 3,564 termos que nosso coletor segue, que tendem para as categorias em que nossos clientes trabalham em vez de uma amostra aleatória da App Store. A contagem de avaliações é uma proxy para a base de instalações e ruidosa, já que apps pedem em taxas muito diferentes. A posição é observacional: não podemos randomizar a média de estrelas de um app, então nada aqui é uma estimativa causal. E uma correlação tão pequena seria engolida por qualquer efeito de categoria que não modelamos.
O que sobrevive a esses limites é a comparação entre dois sinais medidos da mesma forma nos mesmos dados. Qualquer viés que esteja em nossa amostra se aplica a ambos, e a contagem ainda supera o valor em estrelas por aproximadamente seis para um.
Pesquise uma palavra-chave grátis
Pesquise uma palavra-chave grátis
AsoTheory, como as pontuações funcionam
Relacionado
- Rastreador gratuito de classificação de apps: um fluxo de trabalho prático para equipes pequenas
- Da pesquisa de palavras-chave a um teste de listagem
- alternativas ao data.ai para desenvolvedores independentes
- Páginas de produto personalizadas agora podem ganhar tráfego de busca orgânica na App Store. A maioria dos desenvolvedores não ativou isso
Blog · Estudos de caso · Free ASO tools · Produtos · Privacidade e termos · AsoTheory