Standard målefeil: hvor mye skåren din kan avvike
Hver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
Standardmålefeilen gjør en abstrakt reliabilitetskoeffisient om til noe konkret: et pluss/minus-intervall rundt en skår. Den besvarer spørsmålet de fleste resultatskjermer lar stå ubesvart: hvor mye kunne dette tallet ha vært annerledes hvis jeg hadde tatt testen en annen ettermiddag?
Formelen er enkel. Multipliser standardavviket til skalaen med kvadratroten av én minus reliabiliteten. For en skala med standardavvik på 10 og reliabilitet på 0,85 er standardmålefeilen omtrent 3,9 poeng.
Hva intervallet faktisk dekker
Omtrent to tredjedeler av gangene ligger en persons sanne nivå innenfor én standardmålefeil fra den observerte skåren. For å være omtrent 95 prosent sikker trenger du omtrent to standardmålefeil på hver side.
Ta eksempelet over. En person får skåren 62. Intervallet på 95 prosent går fra omtrent 54 til 70. Det er et vindu på seksten poeng, på en skala der den typiske avstanden mellom gjennomsnittlig og tydelig over gjennomsnittet kanskje er ti poeng.
Dette er ikke en svakhet ved akkurat denne testen. En reliabilitet på 0,85 er respektabel. Dette er den normale presisjonen i psykologisk måling, og det er grunnen til at grundige rapporter presenterer intervaller i stedet for enkeltpunkter.
Konsekvensene folk overser
Små forskjeller mellom skalaer er vanligvis meningsløse. Hvis ekstroversjonen din er 58 og åpenheten din er 54, er den ærlige tolkningen at de ikke kan skilles fra hverandre. Profiltolkninger som bygger en fortelling på forskjeller på fire poeng, leser støy.
Små endringer over tid er vanligvis også meningsløse. Å ta en test på nytt og flytte seg fem poeng er innenfor målefeilen for de fleste instrumenter. Reell endring i trekk skjer over år og viser seg som bevegelse godt utenfor feilintervallet, ikke som noen få poeng fra måned til måned.
Rangeringer forsterker problemet. En forskjell på noen få råskårpoeng kan flytte noen ti persentilplasser i den tette midten av en fordeling, fordi det er der de fleste befinner seg. Persentilranger ser presise ut, men er den minst stabile måten å uttrykke en skår på.
Presisjonen er ikke jevn langs skalaen. Klassisk testteori antar én feilverdi for hver skår, noe som er en forenkling. Item response-teori modellerer feilen separat på hvert nivå av trekket, og den er nesten alltid større i ytterpunktene: nettopp der de mest konsekvensrike tolkningene gjøres. En svært høy eller svært lav skår er typisk mindre presis enn en middels skår, ikke mer.
Hvorfor ærlig rapportering virker mindre imponerende
Et instrument som rapporterer konfidensintervaller, virker mer vagt enn et som rapporterer ett enkelt tall med én desimal. Det vage forteller sannheten. Det som ser presist ut, har den samme underliggende målefeilen og har valgt å ikke vise den.
Dette er verdt å huske når du sammenligner en vitenskapelig dokumentert test med et kommersielt produkt som plasserer deg i en kategori. Kategorigrensen ligger ved en bestemt skår, og en som ligger ett poeng under den og en som ligger ett poeng over, er statistisk sett den samme personen. Typemerkelappen skjuler dette fullstendig. Det er et av de mer alvorlige argumentene mot typebaserte instrumenter, og grunnen til at kontinuerlige skårer med oppgitt målefeil er standarden i forskning.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.