แอปที่มีคะแนน 4.8 ดาวติดอันดับสูงกว่าหรือไม่? เราวิเคราะห์การค้นหา App Store 1,000 รายการ
Apple ระบุคะแนนเป็นปัจจัยการจัดอันดับ ดังนั้นความเชื่อพื้นบ้านจึงตามมา: ได้ 4.8 แล้วคุณจะไต่ขึ้น เรานำชุดผลลัพธ์ 1,000 ชุด ผลการค้นหาเดี่ยว 18,796 รายการ และดู ค่าดาวอธิบายแทบไม่มีอะไร จำนวนคะแนนอธิบายมากกว่าหกเท่า
ทำไมคำถามนี้จึงควรถามอย่างจริงจัง
Apple ระบุว่าผลการค้นหาอิงจาก “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)” ประโยคเดียวนี้เป็นต้นกำเนิดของคำแนะนำจำนวนมหาศาลเกี่ยวกับการไล่ตามค่าเฉลี่ยดาวที่สูงขึ้น โดยมักระบุว่า 4.8 เป็นเกณฑ์ที่สำคัญ
แต่ “ratings and reviews” คลุมเครือตรงจุดที่สำคัญพอดี มันอาจหมายถึงค่าดาว หรือจำนวนคนที่ให้ดาว หรือทั้งคู่ สิ่งเหล่านี้ต่างกันและบ่งบอกถึงงานที่ต่างกันโดยสิ้นเชิง: การเพิ่มค่าเฉลี่ยเป็นปัญหาผลิตภัณฑ์ และการเพิ่มจำนวนเป็นปัญหาการกระจาย
วิธีการ
เราเก็บผลการค้นหารายวันสำหรับคำที่ลูกค้าของเราติดตาม สำหรับการศึกษานี้ เราใช้ทุกคำและประเทศที่แตกต่างกันที่ตัวรวบรวมเห็นในเจ็ดวันถึงวันที่ 12 กันยายน 2026 แต่ละรายการนับครั้งเดียวที่การสังเกตล่าสุด และเก็บชุดผลลัพธ์ที่อย่างน้อยแปดใน 20 อันดับแรกมีทั้งค่าดาวและจำนวนการให้คะแนนในไฟล์ นั่นให้ชุดผลลัพธ์ 1,000 ชุด และผลการค้นหารายตัว 18,796 รายการ
การนับแต่ละคำเพียงครั้งเดียวสำคัญ การค้นหาเดียวกันในวันติดต่อกันให้แอปเกือบชุดเดียวกันในลำดับเกือบเหมือนกัน ดังนั้นการนับสองครั้งจะเพิ่มตัวอย่างเป็นสองเท่าโดยไม่เพิ่มข้อมูลใดๆ และทำให้ทุกตัวเลขดูแน่นอนเกินจริง
ภาพดิบ: เกือบแบน
มีความชัน และมันเล็กมาก ช่วงที่ได้คะแนนดีที่สุดไม่ใช่ช่วงที่อยู่ในตำแหน่งดีที่สุด: 4.5-4.7 เฉือนชนะ ต่ำกว่า 4.5 ความแตกต่างประมาณหนึ่งตำแหน่งจากยี่สิบ และกลุ่มที่ต่ำกว่า 3.0 อยู่ในตำแหน่งที่ดีกว่ากลุ่ม 3.0-3.9 ซึ่งเป็นการกลับทิศแบบที่คุณเห็นเมื่อผลส่วนใหญ่เป็นสัญญาณรบกวน
ตัวเลขติดลบหมายความว่าค่าที่สูงกว่าอยู่ใกล้ตำแหน่งที่หนึ่ง ทั้งคู่เป็นเช่นนั้น และจำนวนนับแรงกว่าประมาณหกเท่าของสัญญาณที่แรงกว่า ไม่มีค่าใดใหญ่: แม้แต่จำนวนนับก็อธิบายตำแหน่งของแอปได้เพียงไม่กี่เปอร์เซ็นต์ ซึ่งเป็นเครื่องเตือนใจที่มีประโยชน์ว่าความเกี่ยวข้อง ไม่ใช่ความนิยม เป็นตัวทำงานส่วนใหญ่ในผลการค้นหา
ตัวกวน และสิ่งที่เกิดขึ้นเมื่อคุณลบมันออก
ดาวและจำนวนการให้คะแนนไปด้วยกัน ดังนั้นการเปรียบเทียบแบบดิบไม่สามารถแยกพวกมันได้ ในตัวอย่างของเรา ช่วง 4.5-4.7 มีค่ามัธยฐาน 13,507 การให้คะแนน และช่วง 3.0-3.9 มี 72 การเปรียบเทียบสองกลุ่มนั้นส่วนใหญ่เป็นการเปรียบเทียบแอปใหญ่กับแอปเล็ก
ดังนั้นเราจึงแบ่งตำแหน่งเดียวกันออกเป็นช่วงของจำนวนการให้คะแนนที่ใกล้เคียงกันและดูผลของดาวภายในแต่ละช่วง ซึ่งตัวกวนถูกควบคุมไว้เป็นส่วนใหญ่
อ่านลงตามคอลัมน์แล้วผลของขนาดชัดเจน: ช่วงดาวเดียวกันเลื่อนจากประมาณตำแหน่ง 12 ไปเป็นประมาณตำแหน่ง 9 เมื่อจำนวนการให้คะแนนเพิ่มขึ้น อ่านข้ามแถวแล้วผลของดาวเล็กน้อย ไม่สม่ำเสมอ และในช่วงที่เล็กที่สุดกลับตรงกันข้าม — แอปที่ได้คะแนน 4.8-5.0 ที่มีการให้คะแนนต่ำกว่า 200 อยู่ในตำแหน่งต่ำสุดของกลุ่มใดๆ ในตาราง
การกลับทิศนั้นไม่ลึกลับ ค่าเฉลี่ย 4.9 จากรีวิว 30 รายการมักเป็นของแอปที่เล็กมาก และการที่เล็กมากคือสิ่งที่แสดงออกมาในตำแหน่ง มันเป็นการสาธิตที่ชัดเจนว่าทำไมความชันดิบไม่ควรถูกอ่านเป็นผลของดาว
การทดสอบที่สะอาดกว่า: เปรียบเทียบภายในชุดผลลัพธ์เดียว
การเปรียบเทียบคำศัพท์การเงินกับคำศัพท์เกมปริศนาเป็นการเปรียบเทียบประชากรสองกลุ่มที่ต่างกัน การเปรียบเทียบสามอันดับแรกกับตำแหน่ง 8-20 ของการค้นหาเดียวกันไม่ใช่ เราทำการทดสอบจับคู่นั้นกับชุดผลลัพธ์ 990 ชุดที่มีแอปที่ได้คะแนนเพียงพอทั้งสองปลาย
แอปที่อยู่บนสุดของชุดผลลัพธ์ได้คะแนนสูงกว่าแอปที่อยู่ล่างสุด 0.023 ดาว พวกมันมีจำนวนการให้คะแนนมากกว่าประมาณเก้าเท่า กลุ่มที่ได้คะแนนสูงกว่าครองสามอันดับแรกใน 52.6% ของชุด และอันดับล่างใน 22.8% ดังนั้นทิศทางเป็นจริง — แต่ขนาดนั้นเล็กน้อยมาก
สิ่งที่วรรณกรรมกล่าว
นี่ไม่ใช่คำถามใหม่ในเชิงวิชาการ และงานที่ตีพิมพ์ก็ลงเอยในจุดที่คล้ายกัน Sällberg, Wang และ Numminen เขียนใน Journal of Marketing Analytics ในปี 2022 ติดตามแอป 341 ตัวทุกวันประมาณสองปีนับจากการเปิดตัวใน App Store และแยกข้อมูลคะแนนออกจากข้อความรีวิว สำหรับแอปเพิ่มผลผลิต พวกเขารายงานว่าคะแนนเฉลี่ยไม่มีผลโดยตรงที่มีนัยสำคัญต่อยอดดาวน์โหลด ในขณะที่ปริมาณการให้คะแนนมีผล สำหรับแอปเกม ผลของปริมาณเป็นลบ ซึ่งเป็นคำเตือนไม่ให้ถือว่าสิ่งเหล่านี้เป็นคันโยกง่ายๆ
งานด้านองค์ประกอบภาพชี้ไปทางเดียวกันเกี่ยวกับข้อจำกัดของการคิดแบบตัวแปรเดียว: Wang และ Li ใน Electronic Commerce Research ในปี 2016 สกัดคุณลักษณะสี ความซับซ้อน และความสมมาตรจากไอคอน Android และพบความสัมพันธ์ที่วัดได้กับพฤติกรรมการดาวน์โหลด สาขาการทำเหมือง App Store ที่กว้างขึ้นเริ่มต้นด้วย Harman, Jia และ Zhang ที่ MSR 2012 ซึ่งพิสูจน์ว่าข้อมูลเมตาดาต้าของร้านค้าสามารถวิเคราะห์ในระดับใหญ่ได้
สิ่งนี้หมายความว่าอย่างไรสำหรับลิสต์ของคุณ
ข้อจำกัดของการศึกษานี้
หนึ่งสัปดาห์ เฉพาะ iOS และคำ 3,564 คำที่ตัวรวบรวมของเราติดตาม ซึ่งเอนเอียงไปทางหมวดหมู่ที่ลูกค้าของเราทำงานอยู่มากกว่าตัวอย่างสุ่มของ App Store จำนวนการให้คะแนนเป็นตัวแทนของฐานการติดตั้งและมีสัญญาณรบกวน เนื่องจากแอปกระตุ้นให้ให้คะแนนในอัตราที่ต่างกันมาก ตำแหน่งเป็นการสังเกต: เราไม่สามารถสุ่มค่าเฉลี่ยดาวของแอปได้ ดังนั้นไม่มีอะไรที่นี่เป็นการประมาณเชิงสาเหตุ และสหสัมพันธ์ที่เล็กขนาดนี้จะถูกกลบด้วยผลของหมวดหมู่ใดๆ ที่เราไม่ได้จำลอง
สิ่งที่รอดจากข้อจำกัดเหล่านั้นคือการเปรียบเทียบระหว่างสัญญาณสองตัวที่วัดด้วยวิธีเดียวกันบนข้อมูลเดียวกัน อคติใดก็ตามที่อยู่ในตัวอย่างของเรามีผลกับทั้งคู่ และจำนวนยังคงเหนือกว่าค่าดาวประมาณหกต่อหนึ่ง
เกี่ยวข้อง
- ตัวติดตามอันดับแอปฟรี: เวิร์กโฟลว์ปฏิบัติสำหรับทีมขนาดเล็ก
- จากการวิจัยคำหลักสู่การทดสอบรายการ
- ทางเลือก data.ai สำหรับนักพัฒนาอินดี้
- หน้าผลิตภัณฑ์ที่กำหนดเองสามารถชนะการเข้าชมจากการค้นหาแบบออร์แกนิกของ App Store ได้แล้ว นักพัฒนาส่วนใหญ่ยังไม่ได้เปิดใช้งาน
บล็อก · กรณีศึกษา · Free ASO tools · ผลิตภัณฑ์ · ความเป็นส่วนตัวและข้อกำหนด · AsoTheory