Hvad er validitet i psykologisk testning?
Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
Validitet handler om, hvorvidt en test måler det, den hævder at måle, og om de konklusioner, folk drager ud fra dens scores, er berettigede. Det er det centrale spørgsmål i psykometri og det, der oftest besvares med en markedsføringspåstand frem for evidens.
Den moderne forståelse, som har stået ved magt siden Messicks arbejde i 1980'erne, er, at validitet ikke er en fast egenskab ved et instrument. Det er en egenskab ved en fortolkning af scores til en bestemt anvendelse. Det samme spørgeskema kan være velvalideret til at beskrive en persons selvopfattelse og fuldstændig uvalideret til at afgøre, om personen skal ansættes. At sige "denne test er valid" uden at sige, hvad den er valid til, er ikke en påstand; det er et slogan.
Typerne af evidens
Validitet opbygges af akkumuleret evidens af flere typer. Ældre tekster præsenterer disse som separate former for validitet; den nuværende opfattelse behandler dem som forskellige argumenter, der understøtter én samlet sag.
Indholdsevidens spørger, om itemene dækker konstruktet ordentligt. En depressionsskala, der kun spørger til søvn og appetit, dækker de somatiske symptomer og overser de humørmæssige og kognitive. Indholdsdækning vurderes som regel af fageksperter, og det er grunden til, at meget korte skalaer altid er et kompromis.
Evidens for intern struktur spørger, om itemene grupperer sig, som teorien siger, de bør. Hvis en model hævder fire adskilte facetter, bør faktoranalyse genfinde fire faktorer, og afgørende er det, at det sker i en uafhængig stikprøve, ikke kun i den, skalaen blev bygget på. Rigtig mange instrumenter genfinder deres tilsigtede struktur i udviklingsstikprøven, men ikke i nogen andens.
Relationer til andre variable er der, hvor det meste af arbejdet foregår. Konvergent evidens viser, at skalaen korrelerer med det, den bør korrelere med. Diskriminant evidens viser, at den ikke korrelerer for højt med det, den bør være adskilt fra. Det er et krav, der kronisk overses, og det er det, der får mange nyligt brandede konstrukter til at falde. Kriterieevidens viser, at scoren hænger sammen med et udfald, der betyder noget, enten målt samtidig eller forudsagt på forhånd.
Konsekvensevidens spørger, hvad der sker, når testen bruges. Hvis et instrument systematisk stiller en gruppe ringere af grunde, der ikke har med konstruktet at gøre, er det et validitetsproblem, ikke blot et etisk problem.
Spørgsmålet, der afslører de fleste påstande
Den skarpeste prøve af en validitetspåstand er inkrementel validitet: tilføjer dette instrument noget ud over det, et billigere, ældre og etableret mål allerede fortæller dig?
Et bemærkelsesværdigt antal brandede konstrukter falder her. De korrelerer 0,7 eller højere med et eksisterende Big Five-domæne, forudsiger de samme udfald i samme størrelsesorden og tilføjer intet, når der statistisk kontrolleres for det ældre mål. Konstruktet er nyt; målingen er det ikke. Det er derfor, kritikafsnittene i seriøs instrumentdokumentation så ofte handler om redundans frem for unøjagtighed.
Hvad du skal kigge efter
Når nogen hævder, at en test er valideret, er de nyttige spørgsmål konkrete. Valideret mod hvilket kriterium? I hvilken population, og af hvilken størrelse? Blev faktorstrukturen bekræftet i en uafhængig stikprøve? Findes der publiceret evidens fra forskere uden kommerciel interesse i svaret? Tilføjer den noget ud over et etableret alternativ?
Et instrument med ærlige svar på de spørgsmål er værd at tage alvorligt, begrænsninger inklusive. Et instrument, hvis validering består af en side med udtalelser og en påstand om, at millioner af mennesker har taget det, har besvaret et helt andet spørgsmål: popularitet er ikke evidens, og antallet af mennesker, der har taget en test, siger intet om, hvorvidt dens scores betyder noget.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.