Hvad betyder det, når en test kaldes valideret?
Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
"Videnskabeligt valideret" er ikke en beskyttet betegnelse. Ingen certificerer den, intet organ fører tilsyn med den, og den optræder på produkter, hvis eneste evidensgrundlag er, at mange mennesker har taget dem. Det er værd at vide, hvad den betyder, når den bruges korrekt.
Den korte version
Et valideret instrument har en publiceret dokumentation, der viser, hvad det måler, hvor præcist, i hvilke populationer, og hvad dets scores legitimt kan bruges til. Validering er ikke et certifikat. Det er en samling evidens, som regel opbygget over år, og som regel med fund, der begrænser brugen af instrumentet i stedet for at smigre det.
Tilstedeværelsen af dokumenterede begrænsninger er et af de bedre tegn. Ægte valideringslitteratur er fuld af dem: denne skala fungerer dårligt hos unge, den facet kan ikke replikeres, skæringspunktet afhænger af populationen. Et produkt, der kun rapporterer styrker, har ikke publiceret sin validering; det har publiceret sin markedsføring.
Fire spørgsmål, der gør arbejdet
Hvad er den oprindelige publikation? Et valideret instrument har en original artikel i et fagfællebedømt tidsskrift med forfattere, et årstal og som regel en DOI. Artiklen beskriver, hvordan items blev udviklet, og hvilke psykometriske egenskaber instrumentet oprindeligt havde. Hvis ingen kan nævne artiklen, er der ingen validering at tale om.
Blev strukturen bekræftet af andre? Udviklingsteamet vil genfinde den struktur, de selv har designet. Det afgørende er, om en uafhængig gruppe med uafhængige data fandt det samme. Det er det mest informative spørgsmål, du kan stille, og det, der oftest forbliver ubesvaret.
Hvilken population blev normerne bygget på, og hvornår? En score er en position i en referencefordeling. Et instrument, der angiver en percentil uden at oplyse, hvilken population den refererer til, har givet dig et tal uden nævner.
Hvad tilføjer det? Inkrementel validitet i forhold til et etableret mål. Rigtig mange brandede konstrukter falder her, fordi de korrelerer så højt med et eksisterende træk, at de ikke forklarer nogen yderligere varians i noget som helst. Det er et normalt udfald af videnskabelig granskning, og det er usynligt, medmindre nogen udfører testen.
Hvor oversættelse komplicerer det
Et instrument, der er valideret på engelsk, er dermed ikke valideret på tysk. Korrekt tværkulturel tilpasning kræver frem- og tilbageoversættelse, ekspertgennemgang, kognitive interviews og derefter en ny psykometrisk undersøgelse på det nye sprog, der tester, om faktorstrukturen holder, og om de enkelte items fungerer ækvivalent på tværs af grupper.
Instrumenter, der springer dette over, er almindelige. Et spørgeskema med en upåklagelig oprindelig validering kan opføre sig helt anderledes på et sprog, hvor et centralt item har en anden konnotation, og det er umuligt at vide uden undersøgelsen. Når en test tilbydes på ti sprog, er det nyttige spørgsmål, om den blev valideret på ti sprog, eller om den blev valideret på ét og oversat til ni.
Hvad validering ikke giver dig
Den gør ikke en score sikker. Et valideret instrument har stadig målefejl, beskriver stadig en regelmæssighed på populationsniveau snarere end en individuel skæbne og måler stadig kun det, dets items når frem til.
Det, validering giver dig, er kendte grænser. Du kan finde ud af, hvor stor fejlen er, i hvilken population og til hvilket formål. Det er en mindre påstand end "denne test afslører, hvem du virkelig er", og det er den eneste, der holder.
Hvis du vil se, hvordan dokumentationen ser ud, når den findes, angiver hver test i NOESIS-kataloget det instrument, den implementerer, dets forfattere og årstal, dets scoringsmetode og evidensen bag det, herunder hvor denne evidens er omstridt.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.