Hvorfor de fleste personlighetstester på internett ikke er reliable
Ikke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
En gratis personlighetstest på nettet og et validert psykometrisk instrument gir resultater som ser helt like ut: en skår, en persentil, et avsnitt som beskriver deg. Forskjellen ligger utelukkende i arbeid du ikke kan se fra resultatskjermen.
Det er verdt å være presis her, fordi den vanlige fremstillingen, at nettester er svindel, stort sett er feil og lite nyttig. De fleste er laget av folk uten noen hensikt om å villede. De er upålitelige av strukturelle grunner.
Hva som vanligvis hoppes over
Leddanalyse. I en skikkelig utviklet skala blir de fleste utkastene til ledd forkastet etter utprøving: ledd der ingen varierer, ledd som korrelerer svakt med totalskåren, ledd som lader på mer enn én faktor, ledd som fungerer ulikt på tvers av alders- eller språkgrupper. En test som er skrevet og publisert uten utprøving, har beholdt alt, også leddene som ikke fungerer.
Uavhengig bekreftelse av strukturen. Faktoranalyse på de samme dataene som skalaen ble bygget på, vil gjenfinne strukturen du designet. Å bekrefte den i et nytt utvalg er en egen studie, og det er i dette steget en stor andel av skalaene faller gjennom.
Normer. Persentilen må komme fra et sted. Hvis nettstedet ikke oppgir referansepopulasjonen sin, er tallet utledet enten fra tidligere besøkende, en selvselektert gruppe med ukjent sammensetning, eller fra ingenting spesielt.
Test-retest-data. For å fastslå at folk får samme skår neste måned, må man finne dem igjen. Nesten ingen gjør dette, og det betyr at den stabiliteten ordet «trekk» forutsetter, ikke er påvist.
Insentivene i designet trekker i feil retning
En test laget for engasjement er optimalisert for et annet utfall enn en test laget for presisjon, og de to trekker fra hverandre på forutsigbare måter.
Smigrende resultater fungerer bedre. Et resultat som forteller deg noe ubehagelig, blir delt sjeldnere, så resultatene glir mot beskrivelser alle kjenner seg igjen i. Dette er Barnum-effekten, påvist på 1940-tallet og pålitelig gjenskapt siden: folk vurderer generelle personlighetsbeskrivelser som svært treffende for akkurat dem selv.
Typer fungerer bedre enn dimensjoner. «Du er en Arkitekt» er lettere å dele enn «du ligger på 68. persentil for åpenhet med et bredt konfidensintervall». Typer skjuler også målefeil, siden en person som ligger ett poeng på hver side av en kategorigrense, får helt forskjellige merkelapper.
Kort fungerer bedre enn tilstrekkelig. Hvert ekstra spørsmål får respondenter til å falle fra, så testene kortes ned til en lengde som maksimerer fullføring, ikke en som dekker konstruktet.
Ingenting av dette er løgn. Det er optimalisering for et annet mål enn presisjon.
Slik avslører du det på rundt tretti sekunder
Se etter et navngitt kildeinstrument med forfattere og årstall. Se etter en opplysning om hvilken populasjon normene kommer fra. Se etter noen som helst erkjennelse av begrensninger eller målefeil. Se etter om resultatet er en kontinuerlig skår eller en kategori. Se etter om den samme siden også lover å finne din ideelle karriere, partner eller livsmening ut fra tjue spørsmål.
En test som navngir instrumentet sitt, oppgir kilden, opplyser om normene og sier hva den ikke kan fortelle deg, har gjort jobben. En test som ikke gjør noe av dette, kan fortsatt være en hyggelig måte å bruke fem minutter på, men tallet den gir, er pynt.
Hvert instrument i NOESIS-katalogen oppgir hvilken publisert test det bygger på, hvem som skrev den, hvilket år, hvordan den skåres, og hva resultatene ikke fastslår. Den siste delen er den som er verdt å sammenligne med.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.