Hva er reliabilitet i psykologisk testing?
Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
Reliabilitet er graden av at en måling kan gjentas, i stedet for å være støy. Hvis du veide deg tre ganger i løpet av ett minutt og fikk 71, 78 og 66 kilo, ville vekten vært upålitelig, og du ville ikke hatt noen mulighet til å finne din faktiske vekt ut fra den. Psykologisk måling står overfor det samme problemet med langt mindre presist utstyr.
Det viktigste å forstå om reliabilitet er hva den ikke hevder. En badevekt som konsekvent viser åtte kilo for mye, er fullstendig reliabel og fullstendig feil. Reliabilitet handler om konsistens; om tallet betyr det riktige, er et eget spørsmål, kalt validitet. Reliabilitet er nødvendig for validitet, men langt fra tilstrekkelig.
Formene den tar
Intern konsistens spør om leddene på en skala stemmer overens med hverandre. Hvis ti spørsmål alle skal fange opp det samme underliggende trekket, bør personer som svarer høyt på ett, ha en tendens til å svare høyt på de andre. Dette rapporteres vanligvis som Cronbachs alfa eller, bedre, McDonalds omega.
Test-retest-reliabilitet spør om den samme personen får lignende skår ved to anledninger. Dette er formen som betyr mest for trekk, som per definisjon skal være stabile. Det er også formen som oftest ikke rapporteres, fordi den krever at man oppsporer de samme deltakerne flere uker senere.
Interrater-reliabilitet gjelder når mennesker skårer instrumentet: kliniske intervjuer, projektive teknikker, atferdsobservasjon. Den spør om to trente bedømmere som ser på det samme materialet, kommer til samme konklusjon.
Parallellformreliabilitet spør om to ulike versjoner av den samme testen, laget for å være likeverdige, gir de samme skårene. Den har betydning overalt der en test gjennomføres mer enn én gang og eksponering av ledd er en bekymring.
Å lese tallene
Reliabilitetskoeffisienter går fra 0 til 1. Konvensjonene er grove og mye misbrukt, men omtrent slik: over 0,90 kreves der en skår påvirker et individs liv, 0,80 til 0,90 er solid for de fleste anvendte formål, 0,70 til 0,80 er akseptabelt for forskning og for gruppesammenligninger, og under 0,70 betyr at skåren inneholder mer støy enn de fleste konklusjoner tåler.
To forbehold om disse grenseverdiene. For det første er de konvensjoner, ikke lover; det akseptable nivået avhenger helt av hva skåren skal brukes til. For det andre tyder en svært høy alfa på en kort skala vanligvis på at leddene er nesten omskrivninger av hverandre, noe som gir konsistens på bekostning av hvor godt konstruktet dekkes. En skala med ti spørsmål som alle spør «er du organisert?» med litt ulike ord, vil ha utmerket intern konsistens og en snever lesning av planmessighet.
Hva det betyr for din egen skår
Reliabilitet sier direkte hvor stor tillit ett enkelt tall fortjener. En test med en reliabilitet på 0,85 har så stor målefeil at en forskjell på noen få poeng mellom to personer, eller mellom skåren din i dag og skåren din forrige måned, svært sannsynlig er støy snarere enn signal.
Dette er den praktiske konsekvensen: et godt instrument rapporterer reliabiliteten sin, slik at du vet hvor stor usikkerheten rundt skåren din er. Det tekniske uttrykket for denne usikkerheten er standard målefeil, som gjør om en reliabilitetskoeffisient til et pluss-minus-intervall rundt skåren.
Et instrument som ikke rapporterer noe reliabilitetstall i det hele tatt, er ikke dermed mer presist. Det har bare latt være å fortelle deg hvor upresist det er.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.