Hva er Cronbachs alfa, og hva er det ikke?
Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
Cronbachs alfa er en koeffisient for intern konsistens: i hvilken grad leddene i en skala korrelerer med hverandre. Den ble publisert i 1951 og er den psykometriske statistikken som rapporteres oftest, men utbredelsen har vokst seg større enn nytten.
Alfa går fra 0 til 1 og styres av to ting: den gjennomsnittlige korrelasjonen mellom leddene og antallet ledd. Den andre avhengigheten er kilden til de fleste misforståelsene.
Hva en høy alfa ikke betyr
Den betyr ikke at skalaen måler én ting. Dette er den vanligste feilen. Alfa kan være høy for en skala med to eller tre ulike faktorer, så lenge leddene samlet sett korrelerer nok. Endimensjonalitet må fastslås med faktoranalyse; alfa kan ikke fastslå det og var aldri ment å gjøre det.
Den betyr ikke at skalaen har validitet. Alfa sier ingenting om hva leddene måler. Tjue spørsmål om skostørrelse ville hatt utmerket intern konsistens og null validitet som mål på noe psykologisk.
Den betyr ikke at skalaen er god. Fordi alfa øker med antall ledd, vil en lang skala med middelmådige ledd få høyere skår enn en kort skala med utmerkede ledd. En skala med førti ledd og en gjennomsnittlig korrelasjon mellom leddene på 0,2 havner over 0,90.
En svært høy alfa er ofte et varsel. Over omtrent 0,95 er leddene vanligvis nesten omskrivninger av hverandre. Det gir konsistens på bekostning av dekningen av konstruktet: skalaen måler én smal fasett svært presist og overser resten av konstruktet. Dette kalles attenuasjonsparadokset, og det er grunnen til at mer konsistens ikke alltid er bedre.
Hva den forutsetter
Alfa er en nedre grense for reliabilitet under en bestemt forutsetning: tau-ekvivalens, som betyr at hvert ledd bidrar like mye til det underliggende trekket. Virkelige skalaer oppfyller nesten aldri dette. Leddene varierer i hvor sterkt de lader på faktoren, og når de gjør det, undervurderer alfa reliabiliteten.
McDonalds omega dropper forutsetningen om likt bidrag og estimerer reliabilitet ut fra de faktiske faktorladningene. Metodologer har anbefalt den fremfor alfa i to tiår. Rapporteringspraksisen har vært treg til å følge etter, hovedsakelig fordi alfa er én linje i alle statistikkprogrammer, mens omega ikke er det.
Slik tolker du den i praksis
Grove konvensjoner: 0,70 og høyere er akseptabelt for forskning som sammenligner grupper, 0,80 og høyere for anvendt bruk, og 0,90 og høyere der en skår påvirker en beslutning om en enkeltperson. Bruk disse som orientering, ikke som grenseverdier; det nødvendige nivået avhenger av hva som står på spill i beslutningen skåren ligger til grunn for.
De mer informative tallene finnes vanligvis andre steder i den samme artikkelen. Den gjennomsnittlige korrelasjonen mellom leddene (0,15 til 0,50 er et sunt spenn) forteller deg om den høye alfaen kom av leddenes kvalitet eller leddenes antall. Antallet ledd forteller deg det samme fra motsatt retning. Test-retest-reliabilitet forteller deg noe alfa strukturelt ikke kan: om skåren er stabil hos den samme personen over tid.
En skala som bare rapporterer alfa, har rapportert det reliabilitetstallet som er enklest å få fram, og det som er minst krevende å bestå.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.