Hvad er Cronbachs alfa, og hvad er det ikke?
Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
Cronbachs alfa er en koefficient for intern konsistens: den grad, hvori items på en skala korrelerer med hinanden. Den blev publiceret i 1951 og er den mest rapporterede psykometriske statistik overhovedet, og dens udbredelse er vokset ud over dens nytteværdi.
Alfa går fra 0 til 1 og bestemmes af to ting: den gennemsnitlige korrelation mellem items og antallet af items. Den anden afhængighed er kilden til de fleste misforståelser.
Hvad en høj alfa ikke betyder
Den betyder ikke, at skalaen måler én ting. Dette er den mest almindelige fejl. Alfa kan være høj for en skala med to eller tre forskellige faktorer, så længe items samlet set korrelerer tilstrækkeligt. Endimensionalitet skal påvises med faktoranalyse; alfa kan ikke påvise den og var aldrig tænkt til det.
Den betyder ikke, at skalaen er valid. Alfa siger intet om, hvad items måler. Tyve spørgsmål om skostørrelse ville have fremragende intern konsistens og nul validitet som mål for noget psykologisk.
Den betyder ikke, at skalaen er god. Fordi alfa stiger med antallet af items, vil en lang skala med middelmådige items score højere end en kort skala med fremragende items. En skala med fyrre items og en gennemsnitlig inter-item-korrelation på 0,2 lander over 0,90.
En meget høj alfa er ofte et advarselstegn. Over cirka 0,95 er items som regel næsten omskrivninger af hinanden. Det giver konsistens på bekostning af dækningen af konstruktet: skalaen måler én snæver facet meget præcist og overser resten af konstruktet. Dette kaldes attenuationsparadokset, og det er grunden til, at mere konsistens ikke altid er bedre.
Hvad den forudsætter
Alfa er en nedre grænse for reliabilitet under en bestemt forudsætning: tau-ækvivalens, dvs. at hvert item bidrager lige meget til det underliggende træk. Virkelige skalaer opfylder næsten aldrig dette. Items varierer i, hvor stærkt de lader på faktoren, og når de gør det, undervurderer alfa reliabiliteten.
McDonalds omega dropper forudsætningen om lige store bidrag og estimerer reliabiliteten ud fra de faktiske faktorladninger. Metodologer har anbefalet den frem for alfa i to årtier. Rapporteringspraksis har været langsom til at følge med, hovedsageligt fordi alfa er en enkelt linje i enhver statistikpakke, og det er omega ikke.
Sådan læser du den i praksis
Grove tommelfingerregler: 0,70 og derover er acceptabelt i forskning, der sammenligner grupper, 0,80 og derover ved anvendt brug, 0,90 og derover, når en score påvirker en beslutning om en enkeltperson. Betragt disse som pejlemærker, ikke skæringspunkter; det nødvendige niveau afhænger af, hvor meget der står på spil i den beslutning, scoren danner grundlag for.
De mere informative tal findes som regel andre steder i den samme artikel. Den gennemsnitlige inter-item-korrelation (0,15 til 0,50 er et sundt interval) fortæller dig, om en høj alfa skyldes itemkvalitet eller itemkvantitet. Antallet af items fortæller dig det samme fra den modsatte side. Test-retest-reliabilitet fortæller dig noget, som alfa strukturelt ikke kan: om scoren er stabil hos den samme person over tid.
En skala, der kun rapporterer alfa, har rapporteret det letteste af reliabilitetstallene at fremskaffe og det mindst krævende at bestå.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.
- Screening er ikke diagnoseEt screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.