Normer og persentiler: hva skåren din sammenlignes med
En råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
Du får 34 på en skala for planmessighet. Er det høyt?
Spørsmålet har ikke noe svar uten en sammenligning. Trettifire av hvilket maksimum, i forhold til hvem, målt når? Normer er referansedataene som gjør en råskår om til en tolkbar posisjon, og valget av dem er en av de mer avgjørende beslutningene i testkonstruksjon.
Hvordan omregningen fungerer
Et normutvalg er en gruppe mennesker som har tatt instrumentet under standardiserte betingelser, og hvis skårfordeling blir målestokken. Råskårer uttrykkes deretter som en posisjon i denne fordelingen.
Persentilrang angir hvor stor andel av normutvalget som skårer på eller under deg. Persentil 70 betyr at 70 prosent av referansegruppen skåret lavere. Persentiler er intuitive og har en undervurdert svakhet: De strekker ut forskjeller i den tettpakkede midten av fordelingen og presser dem sammen i endene. Noen få råpoeng rundt gjennomsnittet kan flytte deg mange persentilplasser; de samme få poengene nær toppen flytter deg nesten ingenting.
Standardskårer, som z-skårer, T-skårer, staniner og IQ-lignende skalaer, uttrykker avstanden fra gjennomsnittet i standardavvikenheter. De bevarer den faktiske avstanden mellom skårene, og derfor foretrekkes de når resultatene skal brukes i regneoperasjoner.
Hvorfor referansegruppen er helt avgjørende
Den samme råskåren kan havne på svært ulike persentiler avhengig av normutvalget. Planmessighet skåret mot en generell voksenbefolkning og mot et utvalg yrkesaktive regnskapsførere vil ikke gi samme persentil, og ingen av tallene er feil. De svarer på ulike spørsmål.
Derfor er det verdt å kjenne til flere egenskaper ved et normutvalg.
Hvem som var med. Bekvemmelighetsutvalg av psykologistudenter er fortsatt vanlige og representerer et smalt utsnitt av menneskeheten: unge, utdannede og uforholdsmessig ofte fra velstående vestlige land. En norm bygd på dem lar seg dårlig overføre.
Hvor stort det var. Stabile persentilestimater i halene krever store utvalg. Noen hundre personer gir et upålitelig bilde av hvordan persentil 95 ser ut.
Når det ble samlet inn. Normer forskyver seg. Gjennomsnitt i befolkningen på en rekke psykologiske mål har endret seg målbart over tiår, og et normutvalg fra 1995 beskriver ikke lenger befolkningen som tar testen i 2026.
Om det er stratifisert. Mange trekk varierer systematisk med alder og kjønn. Spenningssøking avtar kraftig med alderen; kronotype endrer seg gjennom livsløpet. Å sammenligne en 55-åring med en norm for alle aldre gir en misvisende posisjon på begge.
Hva du bør se etter, og hva det betyr når det mangler
Et godt dokumentert instrument oppgir størrelse, sammensetning, land og årstall for normutvalget, og sier om normene er stratifiserte. Seriøse testmanualer bruker hele kapitler på dette.
De fleste gratis nettbaserte tester oppgir ingenting av dette. De gir deg en persentil uten å si hvilken populasjon den viser til. Den persentilen er enten utledet fra et uoppgitt bekvemmelighetsutvalg, lånt fra en publisert norm samlet inn i en annen populasjon, eller beregnet ut fra personene som tidligere har tatt testen på nettstedet. Det er en selvselektert gruppe med en sammensetning som er ukjent selv for den som driver nettstedet.
Persentilen vises likevel på skjermen og ser ut akkurat som en ekte. Det er den tilhørende dokumentasjonen, og bare den, som skiller de to.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.