noesisnoesis
Sådan fungerer måling

Hvad er reliabilitet i psykologisk testning?

Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.

Reliabilitet er den grad, hvori en måling kan gentages i stedet for at være støj. Hvis du vejede dig selv tre gange inden for et minut og fik 71, 78 og 66 kilo, ville vægten være upålidelig, og du ville ikke have nogen mulighed for at kende din faktiske vægt ud fra den. Psykologisk måling står over for det samme problem med langt mindre præcist udstyr.

Det afgørende at forstå ved reliabilitet er, hvad den ikke påstår. En badevægt, der konsekvent viser otte kilo for meget, er fuldstændig pålidelig og helt forkert. Reliabilitet handler om konsistens; om tallet betyder det rigtige, er et separat spørgsmål, der kaldes validitet. Reliabilitet er nødvendig for validitet, men langtfra tilstrækkelig.

De former, den antager

Intern konsistens spørger, om items på en skala stemmer overens med hinanden. Hvis ti spørgsmål alle skal indfange det samme underliggende træk, bør personer, der svarer højt på ét, have en tendens til at svare højt på de andre. Dette rapporteres som regel som Cronbachs alfa eller, bedre, McDonalds omega.

Test-retest-reliabilitet spørger, om den samme person scorer nogenlunde ens ved to lejligheder. Det er den form, der betyder mest for træk, som per definition skal være stabile. Det er også den form, der oftest ikke rapporteres, fordi den kræver, at man finder de samme deltagere igen uger senere.

Interrater-reliabilitet er relevant, når mennesker scorer instrumentet: kliniske interviews, projektive teknikker, adfærdsobservation. Den spørger, om to trænede bedømmere, der ser på det samme materiale, når frem til den samme konklusion.

Parallelform-reliabilitet spørger, om to forskellige versioner af den samme test, konstrueret til at være ækvivalente, giver de samme scores. Den er vigtig overalt, hvor en test gennemføres mere end én gang, og hvor eksponering af items er en bekymring.

Sådan læser du tallene

Reliabilitetskoefficienter går fra 0 til 1. Konventionerne er grove og bliver ofte misbrugt, men groft sagt: over 0,90 kræves, hvor en score påvirker et individs liv, 0,80 til 0,90 er solidt til de fleste anvendte formål, 0,70 til 0,80 er acceptabelt til forskning og gruppesammenligninger, og under 0,70 betyder, at scoren indeholder mere støj, end de fleste konklusioner kan tåle.

To forbehold om disse tærskler. For det første er de konventioner, ikke love: det acceptable niveau afhænger helt af, hvad scoren skal bruges til. For det andet indikerer en meget høj alfa på en kort skala som regel, at items næsten er omskrivninger af hinanden, hvilket køber konsistens på bekostning af dækningen af konstruktet. En skala med ti spørgsmål, der alle spørger "er du organiseret?" med lidt forskellige ord, vil have fremragende intern konsistens og en snæver forståelse af samvittighedsfuldhed.

Hvad det betyder for din egen score

Reliabilitet omsættes direkte til, hvor stor tillid et enkelt tal fortjener. En test med en reliabilitet på 0,85 har en målefejl, der er stor nok til, at en forskel på nogle få point mellem to personer, eller mellem din score i dag og din score sidste måned, med stor sandsynlighed er støj snarere end signal.

Dette er den praktiske konsekvens: et godt instrument rapporterer sin reliabilitet, så du ved, hvor bred usikkerheden omkring din score er. Det tekniske udtryk for denne usikkerhed er standardmålefejlen, som omsætter en reliabilitetskoefficient til et plus/minus-interval omkring scoren.

Et instrument, der slet ikke rapporterer nogen reliabilitet, er ikke dermed mere præcist. Det har blot undladt at fortælle dig, hvor upræcist det er.

Sæt det på prøve

At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.

Læs videre