noesisnoesis
Slik fungerer måling

Standard målefeil: hvor mye skåren din kan avvike

Hver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.

Standardmålefeilen gjør en abstrakt reliabilitetskoeffisient om til noe konkret: et pluss/minus-intervall rundt en skår. Den besvarer spørsmålet de fleste resultatskjermer lar stå ubesvart: hvor mye kunne dette tallet ha vært annerledes hvis jeg hadde tatt testen en annen ettermiddag?

Formelen er enkel. Multipliser standardavviket til skalaen med kvadratroten av én minus reliabiliteten. For en skala med standardavvik på 10 og reliabilitet på 0,85 er standardmålefeilen omtrent 3,9 poeng.

Hva intervallet faktisk dekker

Omtrent to tredjedeler av gangene ligger en persons sanne nivå innenfor én standardmålefeil fra den observerte skåren. For å være omtrent 95 prosent sikker trenger du omtrent to standardmålefeil på hver side.

Ta eksempelet over. En person får skåren 62. Intervallet på 95 prosent går fra omtrent 54 til 70. Det er et vindu på seksten poeng, på en skala der den typiske avstanden mellom gjennomsnittlig og tydelig over gjennomsnittet kanskje er ti poeng.

Dette er ikke en svakhet ved akkurat denne testen. En reliabilitet på 0,85 er respektabel. Dette er den normale presisjonen i psykologisk måling, og det er grunnen til at grundige rapporter presenterer intervaller i stedet for enkeltpunkter.

Konsekvensene folk overser

Små forskjeller mellom skalaer er vanligvis meningsløse. Hvis ekstroversjonen din er 58 og åpenheten din er 54, er den ærlige tolkningen at de ikke kan skilles fra hverandre. Profiltolkninger som bygger en fortelling på forskjeller på fire poeng, leser støy.

Små endringer over tid er vanligvis også meningsløse. Å ta en test på nytt og flytte seg fem poeng er innenfor målefeilen for de fleste instrumenter. Reell endring i trekk skjer over år og viser seg som bevegelse godt utenfor feilintervallet, ikke som noen få poeng fra måned til måned.

Rangeringer forsterker problemet. En forskjell på noen få råskårpoeng kan flytte noen ti persentilplasser i den tette midten av en fordeling, fordi det er der de fleste befinner seg. Persentilranger ser presise ut, men er den minst stabile måten å uttrykke en skår på.

Presisjonen er ikke jevn langs skalaen. Klassisk testteori antar én feilverdi for hver skår, noe som er en forenkling. Item response-teori modellerer feilen separat på hvert nivå av trekket, og den er nesten alltid større i ytterpunktene: nettopp der de mest konsekvensrike tolkningene gjøres. En svært høy eller svært lav skår er typisk mindre presis enn en middels skår, ikke mer.

Hvorfor ærlig rapportering virker mindre imponerende

Et instrument som rapporterer konfidensintervaller, virker mer vagt enn et som rapporterer ett enkelt tall med én desimal. Det vage forteller sannheten. Det som ser presist ut, har den samme underliggende målefeilen og har valgt å ikke vise den.

Dette er verdt å huske når du sammenligner en vitenskapelig dokumentert test med et kommersielt produkt som plasserer deg i en kategori. Kategorigrensen ligger ved en bestemt skår, og en som ligger ett poeng under den og en som ligger ett poeng over, er statistisk sett den samme personen. Typemerkelappen skjuler dette fullstendig. Det er et av de mer alvorlige argumentene mot typebaserte instrumenter, og grunnen til at kontinuerlige skårer med oppgitt målefeil er standarden i forskning.

Sett det på prøve

Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.

Les videre

Standard målefeil: hvor mye skåren din kan avvike | NOESIS