noesisnoesis
Slik fungerer måling

Hva er reliabilitet i psykologisk testing?

Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.

Reliabilitet er graden av at en måling kan gjentas, i stedet for å være støy. Hvis du veide deg tre ganger i løpet av ett minutt og fikk 71, 78 og 66 kilo, ville vekten vært upålitelig, og du ville ikke hatt noen mulighet til å finne din faktiske vekt ut fra den. Psykologisk måling står overfor det samme problemet med langt mindre presist utstyr.

Det viktigste å forstå om reliabilitet er hva den ikke hevder. En badevekt som konsekvent viser åtte kilo for mye, er fullstendig reliabel og fullstendig feil. Reliabilitet handler om konsistens; om tallet betyr det riktige, er et eget spørsmål, kalt validitet. Reliabilitet er nødvendig for validitet, men langt fra tilstrekkelig.

Formene den tar

Intern konsistens spør om leddene på en skala stemmer overens med hverandre. Hvis ti spørsmål alle skal fange opp det samme underliggende trekket, bør personer som svarer høyt på ett, ha en tendens til å svare høyt på de andre. Dette rapporteres vanligvis som Cronbachs alfa eller, bedre, McDonalds omega.

Test-retest-reliabilitet spør om den samme personen får lignende skår ved to anledninger. Dette er formen som betyr mest for trekk, som per definisjon skal være stabile. Det er også formen som oftest ikke rapporteres, fordi den krever at man oppsporer de samme deltakerne flere uker senere.

Interrater-reliabilitet gjelder når mennesker skårer instrumentet: kliniske intervjuer, projektive teknikker, atferdsobservasjon. Den spør om to trente bedømmere som ser på det samme materialet, kommer til samme konklusjon.

Parallellformreliabilitet spør om to ulike versjoner av den samme testen, laget for å være likeverdige, gir de samme skårene. Den har betydning overalt der en test gjennomføres mer enn én gang og eksponering av ledd er en bekymring.

Å lese tallene

Reliabilitetskoeffisienter går fra 0 til 1. Konvensjonene er grove og mye misbrukt, men omtrent slik: over 0,90 kreves der en skår påvirker et individs liv, 0,80 til 0,90 er solid for de fleste anvendte formål, 0,70 til 0,80 er akseptabelt for forskning og for gruppesammenligninger, og under 0,70 betyr at skåren inneholder mer støy enn de fleste konklusjoner tåler.

To forbehold om disse grenseverdiene. For det første er de konvensjoner, ikke lover; det akseptable nivået avhenger helt av hva skåren skal brukes til. For det andre tyder en svært høy alfa på en kort skala vanligvis på at leddene er nesten omskrivninger av hverandre, noe som gir konsistens på bekostning av hvor godt konstruktet dekkes. En skala med ti spørsmål som alle spør «er du organisert?» med litt ulike ord, vil ha utmerket intern konsistens og en snever lesning av planmessighet.

Hva det betyr for din egen skår

Reliabilitet sier direkte hvor stor tillit ett enkelt tall fortjener. En test med en reliabilitet på 0,85 har så stor målefeil at en forskjell på noen få poeng mellom to personer, eller mellom skåren din i dag og skåren din forrige måned, svært sannsynlig er støy snarere enn signal.

Dette er den praktiske konsekvensen: et godt instrument rapporterer reliabiliteten sin, slik at du vet hvor stor usikkerheten rundt skåren din er. Det tekniske uttrykket for denne usikkerheten er standard målefeil, som gjør om en reliabilitetskoeffisient til et pluss-minus-intervall rundt skåren.

Et instrument som ikke rapporterer noe reliabilitetstall i det hele tatt, er ikke dermed mer presist. Det har bare latt være å fortelle deg hvor upresist det er.

Sett det på prøve

Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.

Les videre