Varför de flesta personlighetstest på internet inte är reliabla
Inte för att de är oärliga, utan för att de steg som gör en mätning pålitlig är osynliga, kostsamma och lätta att hoppa över, och att hoppa över dem förändrar ingenting i hur resultatet ser ut.
Ett gratis personlighetstest online och ett validerat psykometriskt instrument ger resultat som ser identiska ut: en poäng, en percentil, ett stycke som beskriver dig. Skillnaden ligger helt i arbete som du inte kan se på resultatskärmen.
Det är värt att vara precis här, eftersom den vanliga inramningen, att internettester är bedrägerier, mestadels är felaktig och inte särskilt användbar. De flesta görs av människor utan avsikt att lura. De är opålitliga av strukturella skäl.
Vad som vanligtvis utelämnas
Itemanalys. I en korrekt konstruerad skala kasseras de flesta utkast till items efter pilottestning: items som ingen varierar i svar på, items som korrelerar dåligt med totalsumman, items som laddar på mer än en faktor, items som beter sig olika mellan ålders- eller språkgrupper. Ett test som skrivits och publicerats utan pilottestning har behållit allt, inklusive de items som inte fungerar.
Oberoende strukturell bekräftelse. Faktoranalys på de data du byggde skalan utifrån kommer att återskapa den struktur du utformade. Att bekräfta den i ett nytt urval är en separat studie, och det är steget där en stor andel skalor misslyckas.
Normer. Percentilen måste komma någonstans ifrån. Om webbplatsen inte anger sin referenspopulation är siffran härledd antingen från tidigare besökare, en självselekterad grupp med okänd sammansättning, eller från ingenting särskilt.
Test-retest-data. Att fastställa att människor får samma poäng nästa månad kräver att man hittar dem igen. Nästan ingen gör detta, vilket innebär att den stabilitet som ordet "drag" antyder inte har påvisats.
Designincitamenten går åt fel håll
Ett test som byggts för engagemang är optimerat för ett annat utfall än ett test som byggts för noggrannhet, och de två drar isär på förutsägbara sätt.
Smickrande resultat presterar bättre. Ett resultat som säger dig något obekvämt delas mer sällan, så resultaten glider mot beskrivningar som alla känner igen sig i. Detta är Barnumeffekten, som visades på 1940-talet och därefter tillförlitligt reproducerats: människor bedömer generiska personlighetsbeskrivningar som mycket träffsäkra specifikt om dem själva.
Typer presterar bättre än dimensioner. "Du är en Arkitekt" är mer delbart än "du ligger på 68:e percentilen på öppenhet med ett brett konfidensintervall". Typer döljer också mätfel, eftersom någon som ligger en poäng på ena eller andra sidan av en kategorigräns får helt olika etiketter.
Kort presterar bättre än tillräckligt. Varje ytterligare fråga tappar respondenter, så tester kortas ner till en längd som maximerar genomförandegrad snarare än en som täcker konstruktet.
Inget av detta är lögner. Det är optimering för ett annat mått än noggrannhet.
Så avgör du på ungefär trettio sekunder
Leta efter ett namngivet källinstrument med författare och årtal. Leta efter en uppgift om vilken population normerna kommer från. Leta efter ett erkännande av begränsningar eller mätfel. Leta efter om resultatet är en kontinuerlig poäng eller en kategori. Leta efter om samma sida också lovar att identifiera ditt idealiska yrke, din idealiska partner eller ditt livssyfte utifrån tjugo frågor.
Ett test som namnger sitt instrument, anger sin källa, redovisar sina normer och säger vad det inte kan berätta för dig har gjort jobbet. Ett som inte gör något av detta kan fortfarande vara ett trevligt sätt att tillbringa fem minuter, men siffran det producerar är dekoration.
Varje instrument i NOESIS-katalogen anger vilket publicerat test det implementerar, vem som skrev det, vilket år, hur det poängsätts, och vad dess resultat inte fastställer. Den sistnämnda delen är den som är värd att jämföra mot.
Sätt det på prov
Att läsa om mätning är en sak. Att se ditt eget poäng rapporterat med källa, normgrupp och begränsningar är en annan. Gratis att göra, ingen registrering krävs.
Fortsätt läsa
- Vad är psykometri?Disciplinen som avgör om en psykologisk mätning är bra, och anledningen till att två test som ställer liknande frågor kan skilja sig enormt åt i vad deras resultat är värda.
- Vad är reliabilitet vid psykologisk testning?Reliabilitet är mätningens konsekvens, inte dess korrekthet. Ett test kan vara mycket reliabelt och ändå mäta fel sak, vilket är varför det är den första frågan som ställs och aldrig den sista.
- Vad är validitet inom psykologisk testning?Validitet är inte en egenskap som ett test har. Det är ett argument för om en viss tolkning av ett visst poäng, för ett visst syfte, är försvarbar, och det måste byggas upp på nytt för varje ny användning.
- Vad är begreppsvaliditet?Den svåraste frågan inom mätning: om det du mäter existerar som du har definierat det, och om ditt instrument når fram till det snarare än till något närliggande.
- Konvergent och diskriminant validitetTvå spegelbildskrav: ett mått måste överensstämma med det det ska överensstämma med, och samtidigt förbli distinkt från det det påstår sig inte vara. De flesta svaga instrument misslyckas med det andra kravet.
- Vad är Cronbachs alfa, och vad det inte ärDen mest rapporterade statistiken inom psykologisk testning, och den mest missförstådda. Alfa säger inte att en skala är endimensionell, och ett högt värde är ofta ett symptom snarare än en dygd.
- Mätningens standardfel: hur mycket din poäng kan avvikaVarje poäng har en felmarginal, och för de flesta psykologiska test är den bredare än vad folk antar. Det här är talet som talar om när en skillnad är verklig och när den är brus.
- Normer och percentiler: vad din poäng jämförs medEn rå poäng är omöjlig att tolka på egen hand. Den blir meningsfull först i jämförelse med en referensgrupp, och vilken grupp som använts är ett av de mest avgörande och minst annonserade fakta om något test.
- Hur ett psykometriskt test faktiskt byggsFrån konstruktdefinition till publicerade normer tar sekvensen år och gallrar bort det mesta av det som går in i den. Att känna till stegen gör det uppenbart vilka som ett snabbt onlinetest hoppade över.
- Vad innebär det när ett test kallas validerat?Ordet är oreglerat och används fritt av produkter som inte gjort något av arbetet. Här är vad det betyder när det betyder något, och de fyra frågorna som skiljer de två fallen åt.
- Vad självskattning kan och inte kan mätaFrågeformulär ber dig vara observatör av dig själv, vilket fungerar bättre för vissa saker än andra. Att veta var metoden är stark och var den brister förändrar hur du läser vilket resultat som helst.
- Vad det innebär när ett test förutsäger någotEn korrelation på 0,30 är ett starkt fynd inom personlighetsforskning och en svag grund för ett beslut om en enskild person. Båda påståendena är sanna, och glappet mellan dem orsakar det mesta av missbruket av testresultat.
- Screening är inte diagnosEtt screeningformulär är byggt för att fånga upp så många möjliga fall som möjligt, och accepterar en hög andel falska positiva som priset för det. Att läsa ett screeningresultat som en diagnos vänder upp och ner på vad det var utformat för att göra.