¿Las apps con calificación de 4.8 estrellas se posicionan más alto? Analizamos 1,000 búsquedas en la App Store
Apple menciona las calificaciones como un factor de posicionamiento, así que el folclore sigue: llega a 4.8 y subirás. Tomamos 1,000 conjuntos de resultados, 18,796 resultados de búsqueda individuales y miramos. El valor de las estrellas no explica casi nada. El número de calificaciones explica seis veces más.
Por qué vale la pena plantear la pregunta correctamente
Apple afirma que los resultados de búsqueda se basan en “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Esa única frase es el origen de una enorme cantidad de consejos sobre perseguir una media de estrellas más alta, normalmente con 4.8 como el umbral que importa.
Pero “ratings and reviews” es ambiguo justo en el lugar que importa. Podría significar el valor de las estrellas, o el número de personas que dejaron una, o ambos. Son cosas diferentes e implican trabajos completamente distintos: subir una media es un problema de producto, y subir un recuento es un problema de distribución.
Método
Recopilamos resultados de búsqueda diarios para los términos que siguen nuestros clientes. Para este estudio tomamos cada término y país distintos que el collector vio en los siete días hasta el 12 de septiembre de 2026, cada uno contado una vez en su observación más reciente, y conservamos los conjuntos de resultados donde al menos ocho de las 20 apps principales tenían tanto un valor de estrellas como un recuento de valoraciones en el archivo. Eso da 1,000 conjuntos de resultados y 18,796 resultados de búsqueda individuales.
Tomar cada término una vez importa. La misma búsqueda en días consecutivos devuelve casi las mismas apps en casi el mismo orden, así que contarla dos veces duplicaría la muestra sin añadir información y haría que cada cifra pareciera más segura de lo que es.
La imagen cruda: casi plana
Hay un gradiente, y es diminuto. La banda mejor calificada no es la banda mejor posicionada: 4.5-4.7 la supera. Por debajo de 4.5 la diferencia es de aproximadamente una posición de veinte, y el grupo por debajo de 3.0 se posiciona mejor que el grupo 3.0-3.9, que es el tipo de inversión que ves cuando un efecto es principalmente ruido.
Un número negativo significa que el valor más alto se sitúa más cerca de la posición uno. Ambos lo hacen, y el recuento es aproximadamente seis veces la señal más fuerte. Ninguno es grande: incluso el recuento explica solo un pequeño porcentaje de dónde se sitúa una app, lo que es un recordatorio útil de que la relevancia, no la popularidad, hace la mayor parte del trabajo en un resultado de búsqueda.
El factor de confusión, y qué pasa cuando lo eliminas
Las estrellas y los recuentos de valoraciones viajan juntos, así que una comparación cruda no puede separarlos. En nuestra muestra la banda 4.5-4.7 tiene una mediana de 13,507 valoraciones y la banda 3.0-3.9 tiene 72. Comparar esos dos grupos es principalmente comparar apps grandes con pequeñas.
Así que dividimos las mismas posiciones en bandas de recuento de valoraciones similar y observamos el efecto de las estrellas dentro de cada banda, donde el factor de confusión se mantiene en gran medida quieto.
Lee una columna hacia abajo y el efecto de la escala es obvio: la misma banda de estrellas se mueve de aproximadamente la posición 12 a aproximadamente la posición 9 a medida que crece el recuento de valoraciones. Lee a lo largo de una fila y el efecto de las estrellas es pequeño, inconsistente, y en la banda más pequeña va al revés — las apps con calificación 4.8-5.0 con menos de 200 valoraciones se situaron más bajo que cualquier grupo de la tabla.
Esa inversión no es misteriosa. Una media de 4.9 de 30 reseñas normalmente pertenece a una app muy pequeña, y ser muy pequeña es lo que se refleja en la posición. Es una demostración clara de por qué el gradiente crudo no debe leerse como un efecto de las estrellas.
Una prueba más limpia: comparar dentro de un mismo conjunto de resultados
Comparar un término financiero con un término de juego de puzles compara dos poblaciones diferentes. Comparar los tres primeros con las posiciones 8-20 de la misma búsqueda no. Ejecutamos esa prueba emparejada en los 990 conjuntos de resultados con suficientes apps puntuadas en ambos extremos.
Las apps en la parte superior de un conjunto de resultados tienen una calificación 0.023 estrellas más alta que las apps en la parte inferior. Tienen aproximadamente nueve veces más valoraciones. El grupo con mayor calificación ocupó los tres primeros puestos en 52.6% de los conjuntos y los últimos en 22.8%, así que la dirección es real — es el tamaño lo que es insignificante.
Lo que dice la literatura
Esta no es una pregunta nueva académicamente, y el trabajo publicado llega a un lugar similar. Sällberg, Wang y Numminen, escribiendo en el Journal of Marketing Analytics en 2022, siguieron 341 apps diariamente durante unos dos años desde su lanzamiento en el App Store y separaron la información de calificación del texto de las reseñas. Para apps de productividad informan que la puntuación media de calificación no tuvo un efecto directo significativo en las descargas, mientras que el volumen de valoraciones sí. Para apps de juegos el efecto del volumen fue negativo, lo cual es en sí mismo una advertencia contra tratar cualquiera de estos como palancas simples.
El trabajo sobre activos visuales apunta en la misma dirección sobre los límites del pensamiento de una sola variable: Wang y Li, en Electronic Commerce Research en 2016, extrajeron características de color, complejidad y simetría de los iconos de Android y encontraron relaciones medibles con el comportamiento de descarga. El campo más amplio de la minería de tiendas de apps se abrió con Harman, Jia y Zhang en MSR 2012, que estableció que los metadatos de la tienda pueden analizarse a escala en absoluto.
Lo que esto significa para tu ficha
Límites de este estudio
Una semana, solo iOS, y los 3,564 términos que sigue nuestro collector, que se inclinan hacia las categorías en las que trabajan nuestros clientes en lugar de una muestra aleatoria del App Store. El recuento de valoraciones es un proxy de la base de instalaciones y ruidoso, ya que las apps solicitan valoraciones a ritmos muy diferentes. La posición es observacional: no podemos aleatorizar la media de estrellas de una app, así que nada aquí es una estimación causal. Y una correlación tan pequeña quedaría anulada por cualquier efecto de categoría que no hayamos modelado.
Lo que sobrevive a esos límites es la comparación entre dos señales medidas de la misma manera en los mismos datos. Cualquier sesgo que haya en nuestra muestra se aplica a ambas, y el recuento aún supera al valor de las estrellas por aproximadamente seis a uno.
Busca una palabra clave gratis
Busca una palabra clave gratis
AsoTheory, cómo funcionan las puntuaciones
Relacionado
- Rastreador gratuito de rankings de apps: un flujo de trabajo práctico para equipos pequeños
- De la investigación de palabras clave a una prueba de ficha
- alternativas a data.ai para desarrolladores independientes
- Las páginas de producto personalizadas ahora pueden ganar tráfico de búsqueda orgánica en la App Store. La mayoría de los desarrolladores no lo han activado
Blog · Casos de estudio · Free ASO tools · Productos · Privacidad y términos · AsoTheory