Apakah aplikasi dengan peringkat 4,8 bintang mendapat peringkat lebih tinggi? Kami menganalisis 1.000 pencarian App Store

Apple menyebut peringkat sebagai input peringkat, jadi cerita rakyat mengikuti: dapatkan 4,8 dan Anda naik. Kami mengambil 1.000 set hasil, 18.796 hasil pencarian individual, dan melihat. Nilai bintang menjelaskan hampir tidak ada. Jumlah peringkat menjelaskan enam kali lebih banyak.

Mengapa pertanyaan ini layak ditanyakan dengan benar

Apple menyatakan bahwa hasil pencarian didasarkan pada “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Kalimat tunggal itu adalah asal dari banyak sekali saran tentang mengejar rata-rata bintang yang lebih tinggi, biasanya dengan 4.8 disebut sebagai ambang batas yang penting.

Tetapi “ratings and reviews” ambigu tepat di tempat yang penting. Itu bisa berarti nilai bintang, atau jumlah orang yang meninggalkannya, atau keduanya. Itu adalah hal yang berbeda dan menyiratkan pekerjaan yang sama sekali berbeda: menaikkan rata-rata adalah masalah produk, dan menaikkan jumlah adalah masalah distribusi.

Metode

Kami mengumpulkan hasil pencarian harian untuk istilah yang dilacak pelanggan kami. Untuk studi ini kami mengambil setiap istilah dan negara berbeda yang dilihat kolektor dalam tujuh hari hingga 12 September 2026, masing-masing dihitung sekali pada pengamatan terbarunya, dan menyimpan set hasil di mana setidaknya delapan dari 20 aplikasi teratas memiliki nilai bintang dan jumlah rating di file. Itu memberikan 1,000 set hasil dan 18,796 hasil pencarian individual.

Mengambil setiap istilah sekali penting. Pencarian yang sama pada hari berturut-turut mengembalikan aplikasi yang hampir sama dalam urutan yang hampir sama, jadi menghitungnya dua kali akan menggandakan sampel tanpa menambah informasi apa pun dan akan membuat setiap angka terlihat lebih pasti daripada sebenarnya.

Gambaran mentah: hampir datar

Ada gradien, dan itu kecil. Band dengan rating terbaik bukanlah band dengan penempatan terbaik: 4.5-4.7 mengunggulinya. Di bawah 4.5 perbedaannya sekitar satu posisi dari dua puluh, dan kelompok di bawah 3.0 menempatkan lebih baik daripada kelompok 3.0-3.9, yang merupakan jenis pembalikan yang kamu lihat ketika efek sebagian besar adalah noise.

Angka negatif berarti nilai yang lebih tinggi berada lebih dekat ke posisi satu. Keduanya memang demikian, dan jumlahnya kira-kira enam kali lebih kuat dari sinyalnya. Tidak ada yang besar: bahkan jumlahnya hanya menjelaskan beberapa persen dari posisi aplikasi, yang merupakan pengingat berguna bahwa relevansi, bukan popularitas, yang melakukan sebagian besar pekerjaan dalam hasil pencarian.

Pembaur, dan apa yang terjadi saat kamu menghilangkannya

Bintang dan jumlah rating berjalan bersama, jadi perbandingan mentah tidak dapat memisahkan mereka. Dalam sampel kami band 4.5-4.7 memiliki median 13,507 rating dan band 3.0-3.9 memiliki 72. Membandingkan dua kelompok itu sebagian besar membandingkan aplikasi besar dengan yang kecil.

Jadi kami membagi penempatan yang sama ke dalam band dengan jumlah rating yang mirip dan melihat efek bintang di dalam setiap band, di mana pembaur sebagian besar ditahan diam.

Baca ke bawah kolom dan efek skala jelas: band bintang yang sama bergerak dari sekitar posisi 12 ke sekitar posisi 9 seiring jumlah rating tumbuh. Baca melintasi baris dan efek bintang kecil, tidak konsisten, dan di band terkecil berjalan mundur — aplikasi dengan rating 4.8-5.0 dengan di bawah 200 rating duduk paling rendah dari kelompok mana pun di tabel.

Pembalikan itu tidak misterius. Rata-rata 4.9 dari 30 ulasan biasanya milik aplikasi yang sangat kecil, dan menjadi sangat kecil itulah yang muncul di posisi. Ini adalah demonstrasi bersih mengapa gradien mentah tidak boleh dibaca sebagai efek bintang.

Uji yang lebih bersih: bandingkan di dalam satu set hasil

Membandingkan istilah keuangan dengan istilah game puzzle membandingkan dua populasi yang berbeda. Membandingkan tiga teratas dengan posisi 8-20 dari pencarian yang sama tidak. Kami menjalankan uji berpasangan itu pada 990 set hasil dengan cukup aplikasi yang dinilai di kedua ujung.

Aplikasi di bagian atas set hasil diberi rating 0.023 bintang lebih tinggi daripada aplikasi di bagian bawahnya. Mereka memiliki kira-kira sembilan kali lebih banyak rating. Kelompok dengan rating lebih tinggi memegang tiga teratas di 52.6% set dan terbawah di 22.8%, jadi arahnya nyata — ukurannya yang dapat diabaikan.

Apa kata literatur

Ini bukan pertanyaan baru secara akademis, dan karya yang diterbitkan mendarat di tempat yang mirip. Sällberg, Wang dan Numminen, menulis di Journal of Marketing Analytics pada 2022, melacak 341 aplikasi setiap hari selama sekitar dua tahun sejak peluncuran App Store mereka dan memisahkan informasi rating dari teks ulasan. Untuk aplikasi produktivitas mereka melaporkan bahwa skor rating rata-rata tidak memiliki efek langsung signifikan pada unduhan, sementara volume rating memilikinya. Untuk aplikasi game efek volume negatif, yang dengan sendirinya merupakan peringatan terhadap memperlakukan semua ini sebagai tuas sederhana.

Pekerjaan pada aset visual menunjuk ke arah yang sama tentang batas pemikiran variabel tunggal: Wang dan Li, dalam Electronic Commerce Research pada 2016, mengekstrak fitur warna, kompleksitas, dan simetri dari ikon Android dan menemukan hubungan yang terukur dengan perilaku unduhan. Bidang yang lebih luas dari penambangan toko aplikasi dibuka dengan Harman, Jia dan Zhang di MSR 2012, yang menetapkan bahwa metadata toko dapat dianalisis dalam skala besar sama sekali.

Apa artinya ini untuk listing-mu

Batasan studi ini

Satu minggu, hanya iOS, dan istilah 3,564 yang diikuti kolektor kami, yang condong ke kategori tempat pelanggan kami bekerja daripada sampel acak App Store. Jumlah rating adalah proksi untuk basis instalasi dan yang berisik, karena aplikasi meminta pada tingkat yang sangat berbeda. Posisi adalah observasional: kami tidak dapat mengacak rata-rata bintang aplikasi, jadi tidak ada di sini yang merupakan estimasi kausal. Dan korelasi sekecil ini akan tertelan oleh efek kategori apa pun yang belum kami modelkan.

Yang bertahan dari batasan itu adalah perbandingan antara dua sinyal yang diukur dengan cara yang sama pada data yang sama. Bias apa pun yang ada di sampel kami berlaku untuk keduanya, dan jumlahnya masih mengungguli nilai bintang sekitar enam banding satu.

Cari kata kunci gratis

Cari kata kunci gratis

AsoTheory, cara kerja skor

Terkait

Blog · Studi kasus · Free ASO tools · Produk · Privasi dan ketentuan · AsoTheory