Hvad er konstruktvaliditet?
Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
Konstruktvaliditet handler om, hvorvidt et instrument måler det teoretiske konstrukt, det hævder at måle, og ikke noget, der korrelerer med det, noget snævrere end det eller slet ikke noget sammenhængende. Det er den dybeste form for validitetsevidens og den, det tager år snarere end ét studie at etablere.
Vanskeligheden er strukturel. Et konstrukt som modstandskraft eller følelsesmæssig intelligens er ikke en genstand; det er en foreslået regelmæssighed i adfærd. For at vise, at en skala måler det, skal du samtidig forsvare påstanden om, at konstruktet findes som beskrevet, og at netop disse items rammer det. De to påstande kan ikke adskilles, og derfor beskrev Cronbach og Meehl, som introducerede idéen i 1955, det som at teste et helt teoretisk netværk snarere end ét instrument.
Hvordan argumentet opbygges
Forudsagte korrelationsmønstre. Teorien siger, hvilke ting konstruktet bør hænge sammen med, og hvor stærkt. Selvmedfølelse bør korrelere positivt med livstilfredshed, negativt med depression og kun moderat med selvværd. Hvis det korrelerede 0,9 med selvværd, ville det ikke være et selvstændigt konstrukt. Hver eneste af disse forudsigelser er en testbar påstand, og hvis én slår fejl, er det informativt.
Forventede gruppeforskelle. Hvis teorien siger, at et træk udvikler sig med alderen eller er forhøjet i en klinisk population, bør instrumentet vise det. Hvis man ikke finder en forskel, som teorien kræver, er det evidens imod instrumentet, teorien eller begge dele.
Respons på intervention. Hvis et konstrukt formodes at kunne trænes, bør scorerne flytte sig efter træning og ikke flytte sig i en kontrolgruppe. Konstrukter, der aldrig reagerer på noget, er svære at skelne fra artefakter.
Intern struktur. Faktorstrukturen bør svare til den teoretiske struktur, og vigtigt nok i en ny stikprøve. Eksplorativ faktoranalyse på udviklingsdataene vil finde den struktur, der blev designet ind; konfirmatorisk analyse på nye data er der, hvor påstanden faktisk testes.
Idéen om multitrait-multimethod
Campbell og Fiskes bidrag fra 1959 var at insistere på, at konstruktvaliditet kræver to ting på én gang: Mål for det samme træk med forskellige metoder bør stemme overens, og mål for forskellige træk med den samme metode bør ikke.
Det er den anden halvdel, de fleste instrumenter har svært ved. Hvis din selvrapporterede empati korrelerer 0,7 med din selvrapporterede venlighed og 0,2 med observatørvurderet empati, er det stærkeste, dit spørgeskema måler, ikke empati. Det er din generelle måde at beskrive dig selv på i spørgeskemaer. Metodevarians er et af de mest vedvarende problemer i forskning baseret på selvrapportering, og det er grunden til, at seriøst valideringsarbejde søger et kriterium, der ikke er et spørgeskema, hvor et sådant findes.
Hvorfor det betyder noget, når du læser dine resultater
Konstruktvaliditet er det, der står mellem en score og dens fortolkning. Når et velvalideret instrument rapporterer, at du scorer højt på et træk, omfatter ræsonnementet bag udsagnet årtiers publiceret arbejde, der har fastslået, at trækket opfører sig som en sammenhængende størrelse, at disse items følger det, og at scoren betyder noget lignende på tværs af de mennesker, der tager testen.
Når en test uden konstruktvalidering rapporterer det samme, er scoren et tal genereret af en algoritme, som ingen har kontrolleret. Begge ser ens ud på resultatskærmen. Forskellen ligger udelukkende i dokumentationen, og derfor er dokumentationen værd at lede efter.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.