noesisnoesis
Hur mätning fungerar

Varför de flesta personlighetstest på internet inte är reliabla

Inte för att de är oärliga, utan för att de steg som gör en mätning pålitlig är osynliga, kostsamma och lätta att hoppa över, och att hoppa över dem förändrar ingenting i hur resultatet ser ut.

Ett gratis personlighetstest online och ett validerat psykometriskt instrument ger resultat som ser identiska ut: en poäng, en percentil, ett stycke som beskriver dig. Skillnaden ligger helt i arbete som du inte kan se på resultatskärmen.

Det är värt att vara precis här, eftersom den vanliga inramningen, att internettester är bedrägerier, mestadels är felaktig och inte särskilt användbar. De flesta görs av människor utan avsikt att lura. De är opålitliga av strukturella skäl.

Vad som vanligtvis utelämnas

Itemanalys. I en korrekt konstruerad skala kasseras de flesta utkast till items efter pilottestning: items som ingen varierar i svar på, items som korrelerar dåligt med totalsumman, items som laddar på mer än en faktor, items som beter sig olika mellan ålders- eller språkgrupper. Ett test som skrivits och publicerats utan pilottestning har behållit allt, inklusive de items som inte fungerar.

Oberoende strukturell bekräftelse. Faktoranalys på de data du byggde skalan utifrån kommer att återskapa den struktur du utformade. Att bekräfta den i ett nytt urval är en separat studie, och det är steget där en stor andel skalor misslyckas.

Normer. Percentilen måste komma någonstans ifrån. Om webbplatsen inte anger sin referenspopulation är siffran härledd antingen från tidigare besökare, en självselekterad grupp med okänd sammansättning, eller från ingenting särskilt.

Test-retest-data. Att fastställa att människor får samma poäng nästa månad kräver att man hittar dem igen. Nästan ingen gör detta, vilket innebär att den stabilitet som ordet "drag" antyder inte har påvisats.

Designincitamenten går åt fel håll

Ett test som byggts för engagemang är optimerat för ett annat utfall än ett test som byggts för noggrannhet, och de två drar isär på förutsägbara sätt.

Smickrande resultat presterar bättre. Ett resultat som säger dig något obekvämt delas mer sällan, så resultaten glider mot beskrivningar som alla känner igen sig i. Detta är Barnumeffekten, som visades på 1940-talet och därefter tillförlitligt reproducerats: människor bedömer generiska personlighetsbeskrivningar som mycket träffsäkra specifikt om dem själva.

Typer presterar bättre än dimensioner. "Du är en Arkitekt" är mer delbart än "du ligger på 68:e percentilen på öppenhet med ett brett konfidensintervall". Typer döljer också mätfel, eftersom någon som ligger en poäng på ena eller andra sidan av en kategorigräns får helt olika etiketter.

Kort presterar bättre än tillräckligt. Varje ytterligare fråga tappar respondenter, så tester kortas ner till en längd som maximerar genomförandegrad snarare än en som täcker konstruktet.

Inget av detta är lögner. Det är optimering för ett annat mått än noggrannhet.

Så avgör du på ungefär trettio sekunder

Leta efter ett namngivet källinstrument med författare och årtal. Leta efter en uppgift om vilken population normerna kommer från. Leta efter ett erkännande av begränsningar eller mätfel. Leta efter om resultatet är en kontinuerlig poäng eller en kategori. Leta efter om samma sida också lovar att identifiera ditt idealiska yrke, din idealiska partner eller ditt livssyfte utifrån tjugo frågor.

Ett test som namnger sitt instrument, anger sin källa, redovisar sina normer och säger vad det inte kan berätta för dig har gjort jobbet. Ett som inte gör något av detta kan fortfarande vara ett trevligt sätt att tillbringa fem minuter, men siffran det producerar är dekoration.

Varje instrument i NOESIS-katalogen anger vilket publicerat test det implementerar, vem som skrev det, vilket år, hur det poängsätts, och vad dess resultat inte fastställer. Den sistnämnda delen är den som är värd att jämföra mot.

Sätt det på prov

Att läsa om mätning är en sak. Att se ditt eget poäng rapporterat med källa, normgrupp och begränsningar är en annan. Gratis att göra, ingen registrering krävs.

Fortsätt läsa

Varför de flesta personlighetstest på internet inte är reliabla | NOESIS