Hvad er psykometri?
Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
Psykometri er den gren af psykologien, der beskæftiger sig med selve målingen. Ikke med hvad ekstroversion betyder, men med om et givet sæt spørgsmål faktisk måler ekstroversion, hvor stor fejlen er i det tal, der kommer ud af det, og hvad det tal har belæg for at forudsige.
Sondringen betyder mere, end den lyder til. Enhver kan skrive tyve spørgsmål om, hvor udadvendt en person er, og lægge svarene sammen. Psykometri er det arbejde, der kommer bagefter: at vise, at de tyve spørgsmål hænger sammen, at de måler én ting og ikke tre, at den samme person scorer nogenlunde det samme næste måned, at scoren hænger sammen med, hvordan personen faktisk opfører sig, og at hele apparatet fungerer på samme måde for en 22-årig i Lissabon som for en 55-årig i München.
Hvorfor der var brug for en disciplin
Fysisk måling har en fordel, som psykologien ikke har: Man kan lægge en meterstok ved siden af det, man måler. Der findes ingen meterstok for samvittighedsfuldhed. Trækket kan ikke observeres direkte; det udledes af adfærd, og svar på et spørgeskema er endnu et lag af slutninger oven på det.
Det er det, psykometrikere kalder en latent variabel: noget, der er virkeligt nok til at have konsekvenser, men som kun kan nås gennem indirekte indikatorer. Hele det metodiske apparat findes på grund af denne indirekthed. Hver teknik, du vil støde på, faktoranalyse, reliabilitetskoefficienter, item response-teori, normstikprøver, er et forsøg på at sige noget forsvarligt om en størrelse, som ingen kan observere.
De tre spørgsmål
Skræl fagsproget væk, og psykometrien stiller tre spørgsmål til ethvert instrument.
Er det konsistent? Hvis målingen for det meste er støj, betyder intet andet noget. Konsistens undersøges på tværs af items (er spørgsmålene enige med hinanden?), over tid (scorer den samme person det samme næste måned?) og på tværs af bedømmere, hvor det er relevant. Det er reliabilitet.
Måler det det, det påstår? Et spørgeskema kan være fuldstændig konsistent og alligevel måle den forkerte ting. En skala, der påstår at måle lederpotentiale, men korrelerer 0,8 med almindeligt selvværd, måler selvværd. Det er validitet, og det er ikke en egenskab, et instrument enten har eller mangler; det er et argument bygget på akkumuleret evidens.
Sammenlignet med hvem? En råscore på 34 betyder intet i sig selv. Den bliver først fortolkelig i forhold til en referencegruppe: 34 er højt i forhold til hvilken population, målt hvornår og hvor? Det er normernes arbejde, og det er det trin, de fleste forbrugertest springer helt over.
Hvordan god praksis ser ud
Et velbygget instrument har et dokumentationsspor. Nogen har offentliggjort, hvordan items blev skrevet, og hvilke der blev kasseret. Nogen har rapporteret reliabilitetskoefficienterne i navngivne stikprøver med stikprøvestørrelser. Nogen har testet, om faktorstrukturen holdt i en anden, uafhængig stikprøve frem for den, der blev brugt til at bygge den. Nogen har undersøgt, om items opfører sig ens på tværs af sprog og aldersgrupper. En anden, helst uden interesse i instrumentet, har forsøgt at replikere resultaterne og rapporteret, hvad der skete.
Intet af dette gør en test ufejlbarlig. Det gør dens begrænsninger kendte, hvilket er en anden og mere nyttig egenskab. Et instrument, hvis målefejl er dokumenteret, fortæller dig, hvor meget du kan stole på en lille forskel mellem to scores. Et instrument uden offentliggjort fejlestimat er ikke mere præcist; det er bare mere tavst om at være upræcist.
Hvor det efterlader læseren
Psykometrien vil ikke fortælle dig, at en test er sand. Den vil fortælle dig, hvor langt en score kan presses, før den holder op med at betyde noget: hvilke spørgsmål den kan besvare, hvilke populationer den er kalibreret på, og hvor stor en forskel skal være, før den er værd at lægge mærke til.
Det er et snævrere løfte end det, de fleste personlighedsprodukter giver. Det er også det eneste løfte, der overlever mødet med evidensen.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.