noesisnoesis
Slik fungerer måling

Hvorfor de fleste personlighetstester på internett ikke er reliable

Ikke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.

En gratis personlighetstest på nettet og et validert psykometrisk instrument gir resultater som ser helt like ut: en skår, en persentil, et avsnitt som beskriver deg. Forskjellen ligger utelukkende i arbeid du ikke kan se fra resultatskjermen.

Det er verdt å være presis her, fordi den vanlige fremstillingen, at nettester er svindel, stort sett er feil og lite nyttig. De fleste er laget av folk uten noen hensikt om å villede. De er upålitelige av strukturelle grunner.

Hva som vanligvis hoppes over

Leddanalyse. I en skikkelig utviklet skala blir de fleste utkastene til ledd forkastet etter utprøving: ledd der ingen varierer, ledd som korrelerer svakt med totalskåren, ledd som lader på mer enn én faktor, ledd som fungerer ulikt på tvers av alders- eller språkgrupper. En test som er skrevet og publisert uten utprøving, har beholdt alt, også leddene som ikke fungerer.

Uavhengig bekreftelse av strukturen. Faktoranalyse på de samme dataene som skalaen ble bygget på, vil gjenfinne strukturen du designet. Å bekrefte den i et nytt utvalg er en egen studie, og det er i dette steget en stor andel av skalaene faller gjennom.

Normer. Persentilen må komme fra et sted. Hvis nettstedet ikke oppgir referansepopulasjonen sin, er tallet utledet enten fra tidligere besøkende, en selvselektert gruppe med ukjent sammensetning, eller fra ingenting spesielt.

Test-retest-data. For å fastslå at folk får samme skår neste måned, må man finne dem igjen. Nesten ingen gjør dette, og det betyr at den stabiliteten ordet «trekk» forutsetter, ikke er påvist.

Insentivene i designet trekker i feil retning

En test laget for engasjement er optimalisert for et annet utfall enn en test laget for presisjon, og de to trekker fra hverandre på forutsigbare måter.

Smigrende resultater fungerer bedre. Et resultat som forteller deg noe ubehagelig, blir delt sjeldnere, så resultatene glir mot beskrivelser alle kjenner seg igjen i. Dette er Barnum-effekten, påvist på 1940-tallet og pålitelig gjenskapt siden: folk vurderer generelle personlighetsbeskrivelser som svært treffende for akkurat dem selv.

Typer fungerer bedre enn dimensjoner. «Du er en Arkitekt» er lettere å dele enn «du ligger på 68. persentil for åpenhet med et bredt konfidensintervall». Typer skjuler også målefeil, siden en person som ligger ett poeng på hver side av en kategorigrense, får helt forskjellige merkelapper.

Kort fungerer bedre enn tilstrekkelig. Hvert ekstra spørsmål får respondenter til å falle fra, så testene kortes ned til en lengde som maksimerer fullføring, ikke en som dekker konstruktet.

Ingenting av dette er løgn. Det er optimalisering for et annet mål enn presisjon.

Slik avslører du det på rundt tretti sekunder

Se etter et navngitt kildeinstrument med forfattere og årstall. Se etter en opplysning om hvilken populasjon normene kommer fra. Se etter noen som helst erkjennelse av begrensninger eller målefeil. Se etter om resultatet er en kontinuerlig skår eller en kategori. Se etter om den samme siden også lover å finne din ideelle karriere, partner eller livsmening ut fra tjue spørsmål.

En test som navngir instrumentet sitt, oppgir kilden, opplyser om normene og sier hva den ikke kan fortelle deg, har gjort jobben. En test som ikke gjør noe av dette, kan fortsatt være en hyggelig måte å bruke fem minutter på, men tallet den gir, er pynt.

Hvert instrument i NOESIS-katalogen oppgir hvilken publisert test det bygger på, hvem som skrev den, hvilket år, hvordan den skåres, og hva resultatene ikke fastslår. Den siste delen er den som er verdt å sammenligne med.

Sett det på prøve

Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.

Les videre