4.8점 평점을 받은 앱이 더 높은 순위를 차지할까요? 1,000개의 App Store 검색을 분석했습니다

Apple은 평가를 순위 입력으로 명명하므로 민속이 따릅니다: 4.8에 도달하면 올라갑니다. 우리는 1,000개의 결과 세트, 18,796개의 개별 검색 결과를 가져와 살펴보았습니다. 별점 값은 거의 아무것도 설명하지 못합니다. 평가 수는 6배 더 많이 설명합니다.

이 질문을 제대로 물어볼 가치가 있는 이유

Apple은 검색 결과가 “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”에 기반한다고 명시합니다. 그 한 문장이 더 높은 별점 평균을 쫓으라는 엄청난 양의 조언의 기원이며, 보통 4.8점이 중요한 임계값으로 언급됩니다.

하지만 “ratings and reviews”는 정확히 중요한 지점에서 모호합니다. 별점 값일 수도, 평가를 남긴 사람 수일 수도, 둘 다일 수도 있습니다. 그것들은 서로 다른 것이며 완전히 다른 작업을 암시합니다. 평균을 올리는 것은 제품 문제이고, 수를 올리는 것은 유통 문제입니다.

방법

우리는 고객이 추적하는 용어에 대한 일일 검색 결과를 수집합니다. 이 연구를 위해 우리는 컬렉터가 12년 9월 2026일까지 7일 동안 본 모든 고유 용어와 국가를 취하고, 각각을 가장 최근 관찰에서 한 번만 세었으며, 상위 20개 앱 중 적어도 8개가 별점 값과 평가 수를 모두 파일에 가지고 있는 결과 세트를 유지했습니다. 그 결과 1,000개의 결과 세트와 18,796개의 개별 검색 결과가 나왔습니다.

각 용어를 한 번만 취하는 것이 중요합니다. 연속된 날의 같은 검색은 거의 같은 앱들을 거의 같은 순서로 반환하므로, 두 번 세면 정보를 추가하지 않고 표본을 두 배로 늘려 모든 수치가 실제보다 더 확실해 보이게 만들 것입니다.

원시 그림: 거의 평평함

기울기가 있지만 아주 작습니다. 가장 높은 평가를 받은 구간이 가장 좋은 위치에 있는 구간은 아닙니다. 4.5-4.7점 구간이 그것을 약간 앞섭니다. 4.5점 미만에서는 차이가 20개 중 약 한 자리이며, 3.0점 미만 그룹이 3.0-3.9점 그룹보다 더 나은 위치에 있는데, 이는 효과가 대부분 노이즈일 때 볼 수 있는 종류의 역전입니다.

음수는 더 높은 값이 1위에 더 가깝다는 뜻입니다. 둘 다 그렇고, 그 수치는 더 강한 신호의 약 6배입니다. 둘 다 크지 않습니다. 심지어 그 수치조차 앱이 어디에 위치하는지의 몇 퍼센트만 설명하는데, 이는 검색 결과에서 관련성이 인기도가 아니라 대부분의 일을 한다는 유용한 상기입니다.

교란 요인, 그리고 그것을 제거하면 일어나는 일

별점과 평가 수는 함께 움직이므로, 원시 비교로는 그것들을 분리할 수 없습니다. 우리 샘플에서 4.5-4.7점 구간은 중앙값 13,507개의 평가를 가지고, 3.0-3.9점 구간은 72개를 가집니다. 이 두 그룹을 비교하는 것은 대체로 큰 앱과 작은 앱을 비교하는 것입니다.

그래서 우리는 같은 배치들을 비슷한 평가 수의 구간으로 나누고, 교란 요인이 대체로 고정된 각 구간 내에서 별점 효과를 살펴보았습니다.

열을 따라 읽으면 규모의 효과가 분명합니다. 같은 별점 구간이 평가 수가 증가함에 따라 약 12위에서 약 9위로 이동합니다. 행을 가로질러 읽으면 별점 효과는 작고 일관성이 없으며, 가장 작은 구간에서는 거꾸로 작동합니다. 4.8-5.0점을 받고 평가 수가 200개 미만인 앱들은 표의 어떤 그룹보다도 가장 낮은 위치에 있었습니다.

그 역전은 신비롭지 않습니다. 30개의 리뷰에서 나온 4.9점 평균은 보통 매우 작은 앱에 속하며, 매우 작다는 것이 위치에 나타나는 것입니다. 이는 원시 기울기를 별점 효과로 읽어서는 안 되는 이유를 깔끔하게 보여줍니다.

더 깔끔한 테스트: 하나의 결과 세트 안에서 비교하기

금융 용어와 퍼즐 게임 용어를 비교하는 것은 서로 다른 두 모집단을 비교하는 것입니다. 같은 검색의 상위 3개와 8-20위를 비교하는 것은 그렇지 않습니다. 우리는 양쪽 끝에 점수가 매겨진 앱이 충분히 있는 990개의 결과 세트에 대해 이 짝지은 테스트를 실행했습니다.

결과 세트의 상단에 있는 앱들은 하단에 있는 앱들보다 별점이 0.023점 더 높습니다. 그들은 대략 9배 많은 평가 수를 가집니다. 더 높은 평가를 받은 그룹은 52.6%의 세트에서 상위 3개를 차지했고 22.8%에서 하위를 차지했으므로, 방향은 실제입니다. 무시할 만한 것은 그 크기입니다.

문헌이 말하는 것

이것은 학술적으로 새로운 질문이 아니며, 발표된 연구도 비슷한 결론에 도달합니다. Sällberg, Wang and Numminen은 2022년 Journal of Marketing Analytics에 기고하여 App Store 출시 후 약 2년 동안 341개의 앱을 매일 추적하고 평가 정보를 리뷰 텍스트와 분리했습니다. 생산성 앱의 경우 평균 평가 점수가 다운로드에 유의미한 직접적 영향을 미치지 않는 반면 평가의 양은 영향을 미친다고 보고합니다. 게임 앱의 경우 양의 효과는 부정적이었으며, 이는 그 자체로 이들 중 어떤 것도 단순한 레버로 취급하지 말라는 경고입니다.

시각적 자산에 대한 연구도 단일 변수 사고의 한계에 대해 같은 방향을 가리킵니다. Wang and Li는 2016년 Electronic Commerce Research에서 Android 아이콘에서 색상, 복잡성, 대칭 특징을 추출하고 다운로드 행동과 측정 가능한 관계를 발견했습니다. 앱 스토어 마이닝의 더 넓은 분야는 Harman, Jia and Zhang이 MSR 2012에서 시작했으며, 이는 스토어 메타데이터가 대규모로 분석될 수 있다는 것을 확립했습니다.

이것이 당신의 리스팅에 의미하는 것

이 연구의 한계

일주일, iOS만, 그리고 우리 컬렉터가 따르는 3,564개의 용어는 App Store의 무작위 샘플이라기보다는 우리 고객들이 작업하는 카테고리에 치우쳐 있습니다. 평가 수는 설치 기반의 대리 변수이며, 앱마다 평가를 요청하는 비율이 매우 다르기 때문에 노이즈가 많습니다. 위치는 관찰적입니다. 앱의 별점 평균을 무작위로 배정할 수 없으므로 여기의 어떤 것도 인과 추정이 아닙니다. 그리고 이렇게 작은 상관관계는 우리가 모델링하지 않은 어떤 카테고리 효과에 의해 압도될 것입니다.

그 한계에서 살아남는 것은 같은 데이터에서 같은 방식으로 측정된 두 신호 간의 비교입니다. 우리 샘플에 있는 어떤 편향도 둘 다에 적용되며, 평가 수는 여전히 별점 값보다 약 6대 1로 더 나은 성과를 냅니다.

키워드를 무료로 조회하세요

키워드를 무료로 조회하세요

AsoTheory, 점수 작동 방식

관련

블로그 · 사례 연구 · Free ASO tools · 제품 · 개인정보 및 약관 · AsoTheory