Hva er konstruktvaliditet?
Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
Konstruktvaliditet handler om hvorvidt et instrument måler det teoretiske konstruktet det hevder å måle, og ikke noe som korrelerer med det, noe som er snevrere enn det, eller ikke noe sammenhengende i det hele tatt. Det er den dypeste formen for validitetsevidens, og den som det tar år, ikke én studie, å etablere.
Vanskeligheten er strukturell. Et konstrukt som resiliens eller emosjonell intelligens er ikke en gjenstand; det er en antatt regelmessighet i atferd. For å vise at en skala måler det, må du samtidig forsvare påstanden om at konstruktet eksisterer slik det er beskrevet, og at akkurat disse leddene fanger det opp. De to påstandene kan ikke skilles fra hverandre, og derfor framstilte Cronbach og Meehl, som introduserte ideen i 1955, det som å teste et helt teoretisk nettverk snarere enn ett instrument.
Hvordan argumentasjonen bygges opp
Forventede korrelasjonsmønstre. Teorien sier hva konstruktet bør henge sammen med, og hvor sterkt. Selvmedfølelse bør korrelere positivt med livstilfredshet, negativt med depresjon og bare moderat med selvfølelse; hvis den korrelerte 0,9 med selvfølelse, ville den ikke vært et eget konstrukt. Hver eneste av disse forventningene er en testbar påstand, og det er informativt når én av dem slår feil.
Forventede gruppeforskjeller. Hvis teorien sier at et trekk utvikles med alderen, eller er forhøyet i en klinisk populasjon, bør instrumentet vise det. Å ikke finne en forskjell som teorien krever, er evidens mot instrumentet, teorien eller begge.
Respons på intervensjon. Hvis et konstrukt skal kunne trenes, bør skårene endre seg etter trening og ikke endre seg i en kontrollgruppe. Konstrukter som aldri responderer på noe, er vanskelige å skille fra artefakter.
Indre struktur. Faktorstrukturen bør samsvare med den teoretiske strukturen, og, viktigst, i et nytt utvalg. Eksplorerende faktoranalyse på utviklingsdataene vil finne den strukturen som ble bygget inn; det er i bekreftende analyse på nye data at påstanden faktisk testes.
Multitrekk-multimetode-ideen
Campbell og Fiskes bidrag fra 1959 var å insistere på at konstruktvaliditet krever to ting samtidig: mål på det samme trekket med ulike metoder bør stemme overens, og mål på ulike trekk med samme metode bør ikke det.
Det er i den andre halvdelen de fleste instrumenter kommer til kort. Hvis den selvrapporterte empatien din korrelerer 0,7 med den selvrapporterte medmenneskeligheten din og 0,2 med observatørvurdert empati, er det sterkeste spørreskjemaet ditt måler ikke empati; det er din generelle måte å beskrive deg selv på i spørreskjemaer. Metodevarians er et av de mest vedvarende problemene i forskning basert på selvrapportering, og det er grunnen til at seriøst valideringsarbeid søker et kriterium som ikke er et spørreskjema, der det finnes et.
Hvorfor dette betyr noe når du leser resultatene dine
Konstruktvaliditet er det som står mellom en skår og tolkningen av den. Når et godt validert instrument rapporterer at du skårer høyt på et trekk, omfatter resonnementet bak den påstanden flere tiår med publisert arbeid som har vist at trekket oppfører seg som en sammenhengende størrelse, at disse leddene fanger det opp, og at skåren betyr omtrent det samme for dem som tar testen.
Når en test uten konstruktvalidering rapporterer det samme, er skåren et tall generert av en algoritme ingen har kontrollert. Begge ser like ut på resultatskjermen. Forskjellen ligger utelukkende i dokumentasjonen, og derfor er dokumentasjonen verdt å lete etter.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.