Konvergent og diskriminant validitet
To spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
Konvergent og diskriminant validitet er de to halvdele af ét og samme krav. Et mål skal korrelere med det, det teoretisk bør korrelere med, og må ikke korrelere for højt med det, det skal være adskilt fra. At opfylde det ene uden det andet er ikke en delvis succes; det er som regel et tegn på, at konstruktet ikke er det, det giver sig ud for at være.
Konvergent validitet
Konvergent evidens viser, at et mål stemmer overens med andre indikatorer for det samme. En ny angstskala bør korrelere betydeligt med etablerede angstskalaer, med klinikeres vurderinger og ideelt set med noget, der ikke er endnu et spørgeskema, fx fysiologiske mål eller observeret undgåelsesadfærd.
Her forventes korrelationer som regel over 0,50, ofte over 0,70, når sammenligningsmålet er et veletableret instrument for det samme konstrukt. Ligger de lavere, måler enten den nye skala eller sammenligningsmålet noget andet.
Der er en fælde. En korrelation på 0,95 med en eksisterende skala er ingen triumf: Den betyder, at det nye instrument er en ompakning, og det ærlige spørgsmål bliver, hvad det tilføjer. Konvergent validitet er en bundgrænse, ikke et mål, der skal maksimeres.
Diskriminant validitet
Diskriminant evidens viser, at målet holder sig adskilt fra de konstrukter, det hævder at adskille sig fra. Det er her, de interessante fejlslag findes.
Mønstret går igen i litteraturen. Grit korrelerer omkring 0,84 med samvittighedsfuldhed, så tæt, at en metaanalyse fandt, at det næsten intet tilføjer til forudsigelse af akademiske resultater, når der kontrolleres for samvittighedsfuldhed. Selvrapporteret emotionel intelligens overlapper i høj grad med emotionel stabilitet, ekstroversion og samvittighedsfuldhed tilsammen. Den fælles varians i den mørke triade forsvinder stort set, når der tages højde for Honesty-Humility fra HEXACO-modellen. I hvert tilfælde blev konstruktet præsenteret som nyt territorium og viste sig at være et omdøbt område på et eksisterende kort.
Det er også i den diskriminante validitet, at metodeeffekter viser sig. Hvis hvert selvrapporteret konstrukt i en undersøgelse korrelerer 0,4 med hvert andet, er den fælles faktor sandsynligvis respondentens svarstil snarere end nogen fælles psykologi.
Testen, der afgør det
Den afgørende procedure er inkrementel validitet: Indsæt først det etablerede mål i en regression, derefter det nye, og se, om det nye forklarer yderligere varians i udfaldet. Gør det ikke det, kan konstruktet stadig være teoretisk interessant, men instrumentet måler ikke noget, feltet ikke allerede havde.
Det er en krævende standard, og rigtig mange publicerede skalaer er aldrig blevet underkastet den. Når de bliver det, er resultatet ofte det ovenfor nævnte fund af redundans. Det er ingen skandale, men normal videnskabelig udlugning; det betyder dog, at et konstrukts popularitet ikke siger noget om, hvorvidt det består testen.
Hvad det ændrer for dig som læser
Når en test rapporterer flere scorer, er det nyttige spørgsmål, om disse scorer faktisk er adskilte. Fire dimensioner, der korrelerer 0,8 med hinanden, er én dimension med fire etiketter, og en profil bygget på dem vil se nuanceret ud, mens den næsten ikke indeholder nogen selvstændig information.
Instrumenter, der rapporterer korrelationerne mellem deres skalaer, lader dig selv kontrollere dette. Instrumenter, der præsenterer en type med fire kvadranter uden nogensinde at vise, hvordan kvadranterne hænger sammen, har gjort kontrollen umulig, og det er som regel netop pointen.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.