Hva det betyr når en test predikerer noe
En korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
Personlighetsforskning rapporterer at planmessighet predikerer jobbprestasjon. Når de leser den setningen, ser de fleste for seg noe langt sterkere enn det dataene viser. Gapet mellom den statistiske påstanden og hverdagsbetydningen av «predikerer» er der mesteparten av feilbruken av psykologiske tester begynner.
Tallene det gjelder
Effektstørrelser i personlighetsforskning rapporteres vanligvis som korrelasjoner. Metaanalytiske verdier for godt etablerte sammenhenger ligger gjerne mellom 0,20 og 0,35. Planmessighet og jobbprestasjon ligger rundt 0,20 til 0,25. Jobbtilfredshet og jobbprestasjon ligger rundt 0,30. Generell mental evne, den sterkeste enkeltprediktoren i feltet, når omtrent 0,50 for komplekst arbeid.
Kvadrerer du en korrelasjon, får du andelen forklart varians. En korrelasjon på 0,25 står for omtrent seks prosent av forskjellene mellom mennesker. Nittifire prosent er noe annet: evner, muligheter, opplæring, ledelse, helse, flaks.
Hvorfor 0,25 likevel er et reelt funn
På befolkningsnivå gir små korrelasjoner betydelige samlede effekter. Hvis du skal velge ut tusen personer, forbedrer en prediktor på 0,25 det gjennomsnittlige resultatet ditt målbart og gjentatte ganger. Forsikringsselskaper og epidemiologer bygger hele virksomheter på effekter av denne størrelsen.
Haken er at den samlede gevinsten og den individuelle prediksjonen er forskjellige størrelser. En korrelasjon på 0,25 betyr at blant personer med høy skår vil flere prestere godt enn blant personer med lav skår, og også at svært mange med høy skår vil prestere dårlig og svært mange med lav skår vil utmerke seg. Begge utsagnene kommer fra det samme tallet.
Det individuelle tilfellet
Dette er steget som hoppes over. En korrelasjon beskriver forholdet mellom to fordelinger. Den gir ikke grunnlag for et utsagn om en bestemt person.
Hvis planmessighet korrelerer 0,25 med prestasjon, snevrer kunnskap om en persons skår på planmessighet inn det sannsynlige spennet for prestasjonen bare litt. Prediksjonsintervallet for ett individ forblir bredt nok til å omfatte nesten hele utfallsspennet. Å få vite at du ligger på 80. persentil for planmessighet forteller deg svært lite om hvordan du vil gjøre det i en bestemt jobb.
Dette er grunnen til at det er dårlig belegg for å bruke personlighetsskårer som et primært utvelgelsesfilter, selv når den underliggende forskningen er solid. Forskningen støtter påstanden om at trekket har betydning. Den støtter ikke påstanden om at en skår forteller deg hva en søker vil gjøre.
To ytterligere forbehold
Å predikere og å forårsake er forskjellige ting. Nesten all denne litteraturen er korrelasjonell. At planmessighet predikerer helseutfall, er forenlig med at planmessighet fører til bedre helseatferd, med at en tredje faktor forårsaker begge, og med omvendt kausalitet. Longitudinelle design snevrer inn mulighetene; de utelukker dem sjelden.
Kriterier basert på selvrapportering blåser opp tallene. Når både prediktoren og utfallet er selvrapportert av samme person samme ettermiddag, presser felles metodevarians korrelasjonen opp. Studier som bruker objektive utfall eller informantvurderinger, rapporterer vanligvis mindre effekter, og det er dem som bør veie tyngst.
Hva en skår faktisk er god for
Lest som beskrivelse snarere enn spådom er en testskår virkelig nyttig. Den forteller deg hvor du står i forhold til en referansepopulasjon på et trekk med dokumenterte konsekvenser, og den gir deg ord for et mønster du kanskje har lagt merke til uten å kunne sette navn på det.
Det er verdt å ha. Det er noe annet enn en prognose, og det er et skille en ærlig rapport bør gjøre for deg i stedet for å overlate til deg å slutte deg til det.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.