Hvorfor de fleste personlighedstest på internettet ikke er reliable
Ikke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
En gratis personlighedstest på nettet og et valideret psykometrisk instrument giver resultater, der ser helt ens ud: en score, en percentil, et afsnit, der beskriver dig. Forskellen ligger udelukkende i arbejde, du ikke kan se på resultatskærmen.
Det er værd at være præcis her, for den gængse fremstilling, at internettests er svindel, er for det meste forkert og ikke særlig nyttig. De fleste er lavet af folk uden nogen hensigt om at vildlede. De er upålidelige af strukturelle grunde.
Hvad der typisk springes over
Itemanalyse. I en korrekt konstrueret skala bliver de fleste udkast til items kasseret efter pilottestning: items, som ingen varierer på, items, der korrelerer svagt med totalen, items, der lader på mere end én faktor, og items, der opfører sig forskelligt på tværs af alders- eller sproggrupper. En test, der er skrevet og offentliggjort uden pilottest, har beholdt det hele, også de items, der ikke virker.
Uafhængig bekræftelse af strukturen. En faktoranalyse på de data, du har bygget skalaen ud fra, vil genfinde den struktur, du har designet. At bekræfte den i en ny stikprøve er et separat studie, og det er netop det trin, hvor en stor del af skalaerne falder igennem.
Normer. Percentilen skal komme et sted fra. Hvis siden ikke oplyser sin referencepopulation, er tallet udledt enten af tidligere besøgende, en selvudvalgt gruppe med ukendt sammensætning, eller af ingenting i særdeleshed.
Test-retest-data. For at fastslå, at folk scorer det samme næste måned, skal man finde dem igen. Næsten ingen gør det, hvilket betyder, at den stabilitet, som ordet "træk" antyder, ikke er påvist.
Designincitamenterne trækker i den forkerte retning
En test, der er bygget til engagement, er optimeret til et andet udfald end en test, der er bygget til præcision, og de to trækker fra hinanden på forudsigelige måder.
Smigrende resultater klarer sig bedre. Et resultat, der fortæller dig noget ubehageligt, bliver delt mindre, så resultaterne glider mod beskrivelser, som alle genkender hos sig selv. Det er Barnum-effekten, påvist i 1940'erne og pålideligt gentaget siden: Folk vurderer generiske personlighedsbeskrivelser som meget præcise om netop dem selv.
Typer klarer sig bedre end dimensioner. "Du er en Arkitekt" er nemmere at dele end "du ligger på 68. percentil for åbenhed med et bredt konfidensinterval". Typer skjuler også målefejl, da en person, der ligger ét point på hver side af en kategorigrænse, får helt forskellige betegnelser.
Kort klarer sig bedre end tilstrækkeligt. Hvert ekstra spørgsmål koster svarpersoner, så tests bliver skåret ned til en længde, der maksimerer gennemførelsen, frem for en, der dækker konstruktet.
Intet af dette er løgn. Det er optimering efter et andet mål end præcision.
Sådan ser du forskel på cirka tredive sekunder
Kig efter et navngivet kildeinstrument med forfattere og årstal. Kig efter en oplysning om, hvilken population normerne stammer fra. Kig efter nogen som helst anerkendelse af begrænsninger eller målefejl. Kig efter, om resultatet er en kontinuerlig score eller en kategori. Kig efter, om den samme side også lover at finde din ideelle karriere, partner eller livsformål ud fra tyve spørgsmål.
En test, der navngiver sit instrument, angiver sin kilde, oplyser sine normer og siger, hvad den ikke kan fortælle dig, har gjort arbejdet. En test, der ikke gør noget af det, kan stadig være en hyggelig måde at bruge fem minutter på, men det tal, den giver, er pynt.
Ethvert instrument i NOESIS-kataloget oplyser, hvilken publiceret test det implementerer, hvem der har skrevet den, i hvilket år, hvordan den scores, og hvad resultaterne ikke fastslår. Det sidste er det, der er værd at sammenligne med.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.