Konvergent og diskriminant validitet
To speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
Konvergent og diskriminant validitet er to halvdeler av ett og samme krav. Et mål må korrelere med det det teoretisk sett bør korrelere med, og det må ikke korrelere for høyt med det det skal være forskjellig fra. Å oppfylle det ene uten det andre er ikke en delvis suksess; det er som regel et tegn på at konstruktet ikke er det det gir seg ut for å være.
Konvergent validitet
Konvergent evidens viser at et mål stemmer overens med andre indikatorer på det samme. En ny angstskala bør korrelere betydelig med etablerte angstskalaer, med klinikervurderinger og, ideelt sett, med noe som ikke er et annet spørreskjema, for eksempel fysiologiske mål eller observert unngåelsesatferd.
Her forventes korrelasjonene vanligvis å ligge over 0,50, ofte over 0,70 når sammenligningsmålet er et veletablert instrument for det samme konstruktet. Under dette måler enten den nye skalaen eller sammenligningsmålet noe annet.
Det finnes en felle. En korrelasjon på 0,95 med en eksisterende skala er ingen triumf; den betyr at det nye instrumentet er en ompakking, og det ærlige spørsmålet blir hva det tilfører. Konvergent validitet er et gulv, ikke et mål som skal maksimeres.
Diskriminant validitet
Diskriminant evidens viser at målet holder seg atskilt fra konstrukter det hevder å skille seg fra. Det er her de interessante feilene finnes.
Mønsteret går igjen i litteraturen. Grit korrelerer rundt 0,84 med planmessighet, så nært at en metaanalyse fant at det tilfører nesten ingenting til prediksjon av akademiske resultater når planmessighet er kontrollert for. Selvrapportert emosjonell intelligens overlapper i stor grad med emosjonell stabilitet, ekstroversjon og planmessighet til sammen. Den felles variansen i den mørke triaden forsvinner i stor grad når Honesty-Humility fra HEXACO-modellen tas med i betraktningen. I hvert tilfelle ble konstruktet presentert som nytt territorium og viste seg å være et omdøpt område på et eksisterende kart.
Det er også i diskriminant validitet at metodeeffekter kommer til syne. Hvis hvert selvrapporterte konstrukt i en studie korrelerer 0,4 med alle de andre, er den felles faktoren trolig respondentens svarstil snarere enn noen felles psykologi.
Testen som avgjør saken
Den avgjørende fremgangsmåten er inkrementell validitet: før det etablerte målet inn i en regresjon først, deretter det nye, og se om det nye forklarer noe ekstra varians i utfallet. Hvis ikke, kan konstruktet fortsatt være teoretisk interessant, men instrumentet måler ikke noe feltet ikke allerede hadde.
Dette er en krevende standard, og svært mange publiserte skalaer har aldri blitt underlagt den. Når de blir det, er resultatet ofte funnet om overflødighet ovenfor. Det er ingen skandale, men vanlig vitenskapelig luking; likevel betyr det at et konstrukts popularitet ikke sier noe om hvorvidt det består testen.
Hva det endrer for en leser
Når en test rapporterer flere skårer, er det nyttige spørsmålet om disse skårene faktisk er forskjellige. Fire dimensjoner som korrelerer 0,8 med hverandre, er én dimensjon med fire etiketter, og en profil bygget på dem vil se nyansert ut, men bære nesten ingen uavhengig informasjon.
Instrumenter som rapporterer korrelasjonene mellom skalaene, lar deg sjekke dette selv. Instrumenter som presenterer en type med fire kvadranter uten noen gang å vise hvordan kvadrantene henger sammen, har gjort sjekken umulig, og det er som regel hele poenget.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.