Hva er validitet i psykologisk testing?
Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
Validitet handler om hvorvidt en test måler det den hevder å måle, og om konklusjonene folk trekker fra skårene, er berettiget. Det er det sentrale spørsmålet i psykometri, og det som oftest besvares med en markedsføringspåstand i stedet for evidens.
Den moderne forståelsen, som har stått seg siden Messicks arbeid på 1980-tallet, er at validitet ikke er en fast egenskap ved et instrument. Det er en egenskap ved en tolkning av skårer for en bestemt bruk. Det samme spørreskjemaet kan være godt validert for å beskrive en persons selvoppfatning og fullstendig uvalidert for å avgjøre om personen skal ansettes. Å si «denne testen er valid» uten å si hva den er valid for, er ingen påstand; det er et slagord.
Typene evidens
Validitet bygges opp av akkumulert evidens av flere typer. Eldre tekster presenterer disse som separate former for validitet; dagens syn behandler dem som ulike argumenter som støtter én og samme sak.
Innholdsevidens spør om leddene dekker konstruktet på en god måte. En depresjonsskala som bare spør om søvn og appetitt, dekker de somatiske symptomene og går glipp av de som gjelder stemningsleie og kognisjon. Innholdsdekning vurderes vanligvis av fageksperter, og det er grunnen til at svært korte skalaer alltid er et kompromiss.
Evidens for intern struktur spør om leddene grupperer seg slik teorien sier de skal. Hvis en modell hevder fire distinkte fasetter, bør faktoranalyse gjenfinne fire faktorer, og det avgjørende er at dette skjer i et uavhengig utvalg, ikke bare i det utvalget skalaen ble utviklet på. Svært mange instrumenter gjenfinner den tiltenkte strukturen i utviklingsutvalget, men ikke i noe annet utvalg.
Relasjoner til andre variabler er der det meste av arbeidet skjer. Konvergent evidens viser at skalaen korrelerer med det den bør korrelere med. Diskriminant evidens viser at den ikke korrelerer for høyt med det den bør være atskilt fra. Dette er et kronisk forsømt krav, og det som feller mange nylig lanserte merkevarekonstrukter. Kriterieevidens viser at skåren henger sammen med et utfall som betyr noe, enten målt samtidig eller predikert på forhånd.
Konsekvensevidens spør hva som skjer når testen tas i bruk. Hvis et instrument systematisk stiller en gruppe svakere av grunner som ikke har med konstruktet å gjøre, er det et validitetsproblem, ikke bare et etisk problem.
Spørsmålet som avslører de fleste påstander
Den skarpeste prøven av en validitetspåstand er inkrementell validitet: tilfører dette instrumentet noe utover det et billigere, eldre og etablert mål allerede forteller deg?
Et bemerkelsesverdig antall merkevarekonstrukter feiler her. De korrelerer 0,7 eller høyere med et eksisterende Big Five-domene, predikerer de samme utfallene i samme størrelsesorden og tilfører ingenting når det eldre målet kontrolleres statistisk. Konstruktet er nytt; målingen er det ikke. Dette er grunnen til at kritikkavsnittene i seriøs instrumentdokumentasjon så ofte dreier seg om redundans heller enn unøyaktighet.
Hva du bør se etter
Når noen hevder at en test er validert, er de nyttige spørsmålene konkrete. Validert mot hvilket kriterium? I hvilken populasjon, og av hvilken størrelse? Ble faktorstrukturen bekreftet i et uavhengig utvalg? Finnes det publisert evidens fra forskere uten kommersiell interesse i svaret? Tilfører den noe utover et etablert alternativ?
Et instrument med ærlige svar på disse spørsmålene er verdt å ta på alvor, begrensninger inkludert. Et instrument der valideringen består av en side med brukeruttalelser og en påstand om at millioner av mennesker har tatt det, har besvart et helt annet spørsmål. Popularitet er ikke evidens, og antallet mennesker som har tatt en test, sier ingenting om hvorvidt skårene betyr noe.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.