Standardmålefejl: hvor meget din score kan afvige
Enhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
Standardfejlen på målingen omsætter en abstrakt reliabilitetskoefficient til noget konkret: et plus-minus-interval omkring en score. Den besvarer det spørgsmål, som de fleste resultatskærme lader stå ubesvaret: hvor meget kunne dette tal have været anderledes, hvis jeg havde taget testen en anden eftermiddag?
Formlen er enkel. Gang skalaens standardafvigelse med kvadratroden af én minus dens reliabilitet. For en skala med en standardafvigelse på 10 og en reliabilitet på 0,85 er standardfejlen cirka 3,9 point.
Hvad intervallet egentlig dækker
I cirka to tredjedele af tilfældene ligger en persons sande placering inden for én standardfejl fra den observerede score. For at være cirka 95 procent sikker skal du bruge omkring to standardfejl til hver side.
Tag eksemplet ovenfor. En person scorer 62. Intervallet på 95 procent går fra cirka 54 til 70. Det er et vindue på seksten point på en skala, hvor den typiske afstand mellem gennemsnitlig og tydeligt over gennemsnittet måske er ti point.
Det er ikke en fejl ved netop den test. En reliabilitet på 0,85 er respektabel. Det er den normale præcision i psykologisk måling, og det er grunden til, at omhyggelige rapporter præsenterer intervaller frem for punkter.
De konsekvenser, folk overser
Små forskelle mellem skalaer er som regel meningsløse. Hvis din ekstroversion er 58 og din åbenhed er 54, er den ærlige læsning, at de ikke kan skelnes fra hinanden. Profilfortolkninger, der bygger en fortælling op omkring forskelle på fire point, læser støj.
Små ændringer over tid er som regel også meningsløse. Hvis du tager en test igen og flytter dig fem point, ligger det inden for fejlmarginen for de fleste instrumenter. Reel ændring i træk sker over år og viser sig som bevægelse et godt stykke uden for fejlintervallet, ikke som nogle få point fra måned til måned.
Rangordninger forstærker problemet. En forskel på nogle få råscorepoint kan flytte en person ti percentilpladser i den tætte midte af en fordeling, fordi det er dér, de fleste befinder sig. Percentilrange ser præcise ud og er den mindst stabile måde at udtrykke en score på.
Præcisionen er ikke ens over hele skalaen. Klassisk testteori antager én fejlværdi for alle scorer, hvilket er en forenkling. Item response-teori modellerer fejlen separat på hvert niveau af trækket, og den er næsten altid større i yderpunkterne, netop dér hvor de mest betydningsfulde fortolkninger foretages. En meget høj eller meget lav score er typisk mindre præcis end en mellemliggende, ikke mere.
Hvorfor ærlig rapportering ser mindre imponerende ud
Et instrument, der rapporterer konfidensintervaller, ser mere vagt ud end et, der rapporterer ét enkelt tal med én decimal. Det vage fortæller sandheden. Det præcist udseende har den samme underliggende fejl og har valgt ikke at vise den.
Det er værd at holde fast i, når du sammenligner en videnskabeligt dokumenteret test med et kommercielt produkt, der placerer dig i en kategori. Kategorigrænsen ligger ved en bestemt score, og en person ét point under den og en person ét point over den er statistisk set den samme person. Typebetegnelsen skjuler det fuldstændigt. Det er et af de mere alvorlige argumenter mod typebaserede instrumenter og grunden til, at kontinuerlige scorer med angivet fejl er standarden i forskning.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.