Hva er psykometri?
Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
Psykometri er den grenen av psykologien som handler om selve målingen. Ikke om hva ekstroversjon betyr, men om hvorvidt et gitt sett med spørsmål faktisk måler ekstroversjon, hvor mye feil det er i tallet som kommer ut, og hva dette tallet har dekning for å forutsi.
Skillet betyr mer enn det kan høres ut som. Hvem som helst kan skrive tjue spørsmål om hvor utadvendt noen er, og summere svarene. Psykometri er arbeidet som kommer etterpå: å vise at de tjue spørsmålene henger sammen, at de måler én ting og ikke tre, at den samme personen får omtrent samme skår neste måned, at skåren henger sammen med hvordan personen faktisk oppfører seg, og at hele apparatet fungerer på samme måte for en 22-åring i Lisboa som for en 55-åring i München.
Hvorfor det trengtes en egen disiplin
Fysisk måling har en fordel som psykologien ikke har: Du kan legge en meterstokk ved siden av det du måler. Det finnes ingen meterstokk for planmessighet. Trekket er ikke direkte observerbart. Det utledes fra atferd, og svar på spørreskjemaer er enda et lag med slutninger oppå det.
Dette er det psykometrikere kaller en latent variabel: noe som er virkelig nok til å få konsekvenser, men som bare kan nås gjennom indirekte indikatorer. Hele det metodiske apparatet finnes på grunn av denne indirekteheten. Hver teknikk du vil møte, som faktoranalyse, reliabilitetskoeffisienter, item response theory og normutvalg, er et forsøk på å si noe forsvarlig om en størrelse ingen kan observere.
De tre spørsmålene
Skreller du bort fagspråket, stiller psykometrien tre spørsmål til ethvert instrument.
Er det konsistent? Hvis målingen for det meste er støy, spiller ingenting annet noen rolle. Konsistens undersøkes på tvers av ledd (stemmer spørsmålene overens med hverandre?), over tid (får den samme personen samme skår neste måned?) og på tvers av bedømmere der det er relevant. Dette er reliabilitet.
Måler det det det hevder å måle? Et spørreskjema kan være helt konsistent og likevel måle feil ting. En skala som hevder å måle lederpotensial, men som korrelerer 0,8 med ren selvfølelse, måler selvfølelse. Dette er validitet, og det er ikke en egenskap et instrument enten har eller mangler. Det er et argument bygget på evidens som er samlet over tid.
Sammenlignet med hvem? En råskår på 34 betyr ingenting i seg selv. Den blir tolkbar først når den holdes opp mot en referansegruppe: 34 er høyt i forhold til hvilken populasjon, målt når og hvor? Dette er normenes oppgave, og det er det steget de fleste forbrukertester hopper helt over.
Hvordan god praksis ser ut
Et godt konstruert instrument har et dokumentasjonsspor. Noen har publisert hvordan leddene ble skrevet, og hvilke som ble forkastet. Noen har rapportert reliabilitetskoeffisientene i navngitte utvalg, med utvalgsstørrelser. Noen har testet om faktorstrukturen holdt i et nytt, uavhengig utvalg, ikke bare i det som ble brukt til å bygge den. Noen har undersøkt om leddene fungerer likt på tvers av språk og aldersgrupper. Noen andre, helst uten egeninteresse i instrumentet, har forsøkt å replisere funnene og rapportert hva som skjedde.
Ingenting av dette gjør en test ufeilbarlig. Det gjør grensene dens mulige å kjenne, og det er en annen og mer nyttig egenskap. Et instrument med dokumentert målefeil forteller deg hvor mye du kan stole på en liten forskjell mellom to skårer. Et instrument uten publisert estimat av målefeilen er ikke mer nøyaktig; det er bare stillere om at det er unøyaktig.
Hvor dette etterlater leseren
Psykometrien vil ikke fortelle deg at en test er sann. Den vil fortelle deg hvor langt en skår kan strekkes før den slutter å bety noe: hvilke spørsmål den kan besvare, hvilke populasjoner den er kalibrert på, og hvor stor en forskjell må være før den er verdt å legge merke til.
Det er et smalere løfte enn de fleste personlighetsprodukter gir. Det er også det eneste løftet som tåler møtet med evidensen.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.