Sådan bliver en psykometrisk test faktisk udviklet
Fra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
Et psykometrisk instrument, der når frem til publicering, har som regel været igennem fem eller seks års arbejde, og det meste af det, der blev skrevet til det, er blevet kasseret undervejs. Det er værd at kende rækkefølgen, fordi hvert trin svarer til en måde, hvorpå en test kan være utilstrækkelig.
1. Definér konstruktet
Før et eneste item skrives, skal konstruktet specificeres så præcist, at man kan sige, hvad der falder uden for det. Det betyder en definition, en beskrivelse af den dimensionelle struktur (én dimension eller flere, og hvis flere, hvordan de hænger sammen) og en eksplicit redegørelse for, hvilke nærliggende konstrukter det skal adskille sig fra.
At springe dette trin over er årsagen til de fleste overflødige instrumenter. En skala, der bygges ud fra en intuitiv fornemmelse af et begreb, ender som regel med at måle et etableret træk under et nyt navn.
2. Udarbejd en itempulje
Der skrives langt flere items, end der vil overleve, typisk tre til fem gange det endelige antal. De kommer fra teori, fra eksisterende instrumenter, fra interviews med personer, der har den oplevelse, der beskrives, og fra fageksperter.
På dette trin gennemgås puljen for indholdsdækning (dækker den hele konstruktet, eller samler den sig om én facet?), for læseniveau, for dobbelttydige formuleringer og for items, der i virkeligheden spørger om noget andet.
3. Pilottest og frasortér
Puljen gives til en første stikprøve. Analysen er overvejende destruktiv.
Items med næsten ingen varians ryger: Et spørgsmål, som alle besvarer ens, skelner ikke mellem nogen. Items, der korrelerer svagt med den samlede score, ryger. Items, der lader på mere end én faktor, ryger. Items, der fungerer forskelligt på tværs af demografiske grupper af grunde, der ikke har med trækket at gøre (differential item functioning), ryger, og netop dette tjek er et af dem, der oftest springes over.
Det, der overlever, er typisk en tredjedel af det, der blev skrevet.
4. Bekræft strukturen i en ny stikprøve
Dette er trinnet, der adskiller seriøse instrumenter fra resten. En faktoranalyse på udviklingsstikprøven vil genfinde den struktur, der blev designet ind i den; det er uundgåeligt, da items blev udvalgt for at frembringe den. Den egentlige prøve er en konfirmatorisk faktoranalyse i en uafhængig stikprøve.
Rigtig mange publicerede skalaer genfinder kun deres tilsigtede struktur i de data, der blev brugt til at bygge dem. Når andre indsamler nye data, dukker faktorerne ikke op. Den slags fejl er så almindelige, at "blev strukturen bekræftet i en uafhængig stikprøve?" er et af de mest effektive spørgsmål at stille om ethvert instrument.
5. Indsaml evidens for validitet
Korrelationer med etablerede mål for det samme konstrukt. Korrelationer med konstrukter, det bør adskille sig fra, og som helst skal være lavere. Sammenhænge med udfald, der betyder noget. Inkrementel validitet ud over det, der allerede findes. Test-retest-stabilitet over et interval, der passer til konstruktet.
Dette trin slutter aldrig. Det fortsætter, så længe instrumentet er i brug, og det er her, instrumenter oftest viser sig at komme til kort, år efter publiceringen.
6. Opbyg normer
En referencestikprøve, der er stor nok og repræsentativ nok for den tilsigtede population, stratificeret hvor trækket varierer med alder eller køn, og dokumenteret med hensyn til år og land. Derefter gentaget med jævne mellemrum, fordi normer forskydes over tid.
7. Oversæt, hvis det skal bruges andre steder
Oversættelse er ikke en sproglig øvelse. En ordentlig tilpasning betyder fremadrettet oversættelse, uafhængig tilbageoversættelse, ekspertgennemgang, kognitive interviews med personer, der taler målsproget, og derefter en ny psykometrisk undersøgelse på det nye sprog for at teste, om strukturen holder, og om items fungerer ækvivalent. Et instrument, der er oversat uden en sådan undersøgelse, er et utestet instrument på det sprog, uanset hvilke meritter det har på originalsproget.
Hvad det betyder for den hurtige quiz
En test, der er skrevet på en eftermiddag, har gennemført trin to. Den kan sagtens give et plausibelt udseende resultat, en percentil og et afsnit med en beskrivelse. De trin, den sprang over, er netop dem, der ville have afgjort, om noget af det overhovedet betyder noget.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.