Sijoittuvatko sovellukset, joilla on 4,8 tähden arvosanat, korkeammalle? Analysoimme 1 000 App Store -hakua

Apple mainitsee arviot sijoituksen syötteenä, joten kansanperinne seuraa: pääse 4,8:aan ja nouset. Otimme 1 000 tulosjoukkoa, 18 796 yksittäistä hakutulosta, ja katsoimme. Tähtiarvo selittää lähes mitään. Arvioiden määrä selittää kuusi kertaa enemmän.

Miksi kysymys kannattaa selvittää huolellisesti

Apple kertoo hakutulosten perustuvan seuraavaan: “text relevance (matches for your app’s title, subtitle, keywords, and primary category), as well as user behavior (downloads, ratings and reviews, and more)”. Tämä tarkoittaa tekstin osuvuutta sekä käyttäjien toimintaa. Tuosta yhdestä lauseesta on syntynyt valtavasti neuvoja tähtikeskiarvon nostamisesta. Ratkaisevaksi rajaksi nimetään usein 4.8.

Ilmaus “ratings and reviews” eli arvosanat ja arvostelut on kuitenkin epäselvä juuri olennaisessa kohdassa. Se voi tarkoittaa tähtiarvoa, arvioiden antajien määrää tai molempia. Nämä ovat eri asioita ja edellyttävät täysin erilaista työtä: keskiarvon nostaminen on tuoteongelma, määrän kasvattaminen jakeluongelma.

Menetelmä

Keräämme päivittäin hakutuloksia asiakkaidemme seuraamille hakusanoille. Tässä tutkimuksessa otimme jokaisen erillisen hakusanan ja maan, jonka kerääjä havaitsi 12 syyskuuta 2026 päättyneen seitsemän päivän aikana. Kukin laskettiin kerran viimeisimmän havainnon perusteella. Mukaan otettiin hakutulosjoukot, joiden 20 kärkituloksesta vähintään kahdeksalle sovellukselle oli tallennettu sekä tähtiarvo että arvioiden määrä. Tuloksena on 1,000 hakutulosjoukkoa ja 18,796 yksittäistä hakutulosta.

Kunkin hakusanan laskeminen vain kerran on tärkeää. Sama haku peräkkäisinä päivinä palauttaa lähes samat sovellukset lähes samassa järjestyksessä. Sen laskeminen kahdesti kaksinkertaistaisi otoksen lisäämättä tietoa ja saisi kaikki luvut näyttämään todellista varmempina.

Raaka näkymä: lähes tasainen

Suuntauksessa on eroa, mutta se on hyvin pieni. Parhaan arvosanan ryhmä ei ole parhaiten sijoittuva ryhmä: 4.5-4.7 on hieman edellä. Alle 4.5 ero on noin yksi sija kahdestakymmenestä. Alle 3.0 jäävä ryhmä sijoittuu paremmin kuin ryhmä 3.0-3.9. Tällainen käänteinen järjestys on tavallinen, kun vaikutus on enimmäkseen kohinaa.

Negatiivinen luku tarkoittaa, että suurempi arvo sijoittuu lähemmäs ensimmäistä sijaa. Näin on molemmissa tapauksissa, mutta arvioiden määrä on noin kuusi kertaa vahvempi signaali. Kumpikaan yhteys ei ole suuri: jopa määrä selittää vain muutaman prosentin sovelluksen sijoituksesta. Tämä muistuttaa siitä, että hakutuloksissa osuvuus tekee suurimman työn, ei suosio.

Sekoittava tekijä ja sen poistamisen seuraukset

Tähtiarvot ja arvioiden määrät kulkevat yhdessä, joten raaka vertailu ei erota niitä toisistaan. Otoksessamme ryhmän 4.5-4.7 arviointimäärän mediaani on 13,507 ja ryhmän 3.0-3.9 mediaani 72. Näiden ryhmien vertailu on pääasiassa suurten ja pienten sovellusten vertailua.

Jaoimme samat sijoitukset samankaltaisen arviointimäärän ryhmiin ja tarkastelimme tähtiarvon vaikutusta kunkin ryhmän sisällä, jolloin sekoittava tekijä pysyy suurelta osin vakiona.

Lue saraketta alaspäin, niin mittakaavan vaikutus näkyy selvästi: saman tähtiryhmän sijoitus muuttuu noin sijasta 12 noin sijaan 9 arvioiden määrän kasvaessa. Riviä poikittain luettaessa tähtiarvon vaikutus on pieni ja epäjohdonmukainen. Pienimmässä ryhmässä se toimii päinvastoin: alle 200 arviota saaneet arvosanan 4.8-5.0 sovellukset sijoittuivat koko taulukon heikoimmin.

Tämä käänteinen järjestys ei ole arvoitus. Arvosana 4.9 yhteensä 30 arviosta kuuluu yleensä hyvin pienelle sovellukselle, ja juuri pieni koko näkyy sijoituksessa. Tämä osoittaa selvästi, miksi raakaa suuntausta ei pidä tulkita tähtiarvon vaikutukseksi.

Selkeämpi testi: vertailu saman hakutulosjoukon sisällä

Talousalan hakusanan vertaaminen pulmapelin hakusanaan tarkoittaa kahden eri joukon vertaamista. Saman haun kolmen kärjen vertaaminen sijoihin 8-20 ei tarkoita sitä. Teimme tämän parittaisen testin 990 hakutulosjoukolle, joissa molemmissa päissä oli riittävästi sovelluksia, joiden arvosanat tunnettiin.

Hakutulosjoukon kärjen sovellusten arvosana on 0.023 tähteä korkeampi kuin sen loppupään sovelluksilla. Niillä on noin yhdeksän kertaa enemmän arvioita. Korkeamman arvosanan ryhmä oli kolmen kärjessä 52.6%:ssa joukoista ja loppupäässä 22.8%:ssa. Suunta on siis todellinen, mutta vaikutuksen koko on vähäinen.

Mitä tutkimuskirjallisuus kertoo

Akateemisesti kysymys ei ole uusi, ja julkaistu tutkimus päätyy samankaltaiseen tulokseen. Sällberg, Wang ja Numminen seurasivat Journal of Marketing Analytics -lehdessä vuonna 2022 julkaistussa tutkimuksessa 341 sovellusta päivittäin noin kahden vuoden ajan niiden App Store -julkaisusta lähtien ja erottivat arviointitiedot arvosteluteksteistä. Tuottavuussovellusten keskiarvosanalla ei heidän mukaansa ollut merkittävää suoraa vaikutusta latauksiin, mutta arvioiden määrällä oli. Pelisovelluksissa määrän vaikutus oli negatiivinen, mikä itsessään varoittaa pitämästä näitä tekijöitä yksinkertaisina säätiminä.

Visuaalisiin aineistoihin liittyvä tutkimus osoittaa samaan suuntaan yhden muuttujan ajattelun rajoista. Wang ja Li erottivat Android-kuvakkeista väriin, monimutkaisuuteen ja symmetriaan liittyviä ominaisuuksia Electronic Commerce Research -lehdessä vuonna 2016 julkaistussa tutkimuksessa ja havaitsivat mitattavia yhteyksiä latauskäyttäytymiseen. Sovelluskauppojen tiedonlouhinnan laajempi tutkimusala sai alkunsa Harmanin, Jian ja Zhangin MSR 2012 -työstä, joka osoitti, että kauppojen metatietoja ylipäätään voidaan analysoida laajassa mittakaavassa.

Mitä tämä tarkoittaa kauppasivullesi

Tutkimuksen rajoitukset

Yksi viikko, vain iOS ja kerääjämme seuraamat 3,564 hakusanaa. Ne painottuvat asiakkaidemme käyttämiin kategorioihin eivätkä muodosta satunnaisotosta App Storesta. Arvioiden määrä on epätarkka käyttäjäkunnan koon mittari, koska sovellukset pyytävät arvioita hyvin eri tahtiin. Sijoitus on havainnoitu muuttuja: emme voi satunnaistaa sovelluksen tähtikeskiarvoa, joten mikään tässä ei ole kausaalinen estimaatti. Näin pieni korrelaatio myös jäisi helposti sellaisen kategoriavaikutuksen alle, jota emme ole mallintaneet.

Rajoituksista huolimatta säilyy kahden samalla tavalla samasta aineistosta mitatun signaalin vertailu. Otoksemme mahdollinen harha koskee molempia, ja arvioiden määrä on silti noin kuusi kertaa tähtiarvoa vahvempi.

Hae avainsana ilmaiseksi

Hae avainsana ilmaiseksi

AsoTheory: pisteiden laskentaperiaatteet

Aiheeseen liittyvä

Blogi · Tapaustutkimukset · Free ASO tools · Tuotteet · Tietosuoja ja ehdot · AsoTheory