Co je Cronbachovo alfa a co není
Nejčastěji uváděná statistika v psychologickém testování a zároveň nejčastěji chybně vykládaná. Alfa ti neřekne, zda je škála jednodimenzionální, a vysoká hodnota je často spíše příznakem problému než předností.
Cronbachovo alfa je koeficient vnitřní konzistence: vyjadřuje míru, do jaké spolu položky škály korelují. Bylo publikováno v roce 1951 a je nejčastěji uváděnou psychometrickou statistikou. Jeho všudypřítomnost však předčila jeho užitečnost.
Alfa nabývá hodnot od 0 do 1 a ovlivňují ho dvě věci: průměrná korelace mezi položkami a počet položek. Právě druhá závislost je zdrojem většiny nedorozumění.
Co vysoké alfa neznamená
Neznamená, že škála měří jednu věc. To je nejčastější omyl. Alfa může být vysoké i u škály se dvěma nebo třemi odlišnými faktory, pokud položky jako celek dostatečně korelují. Jednodimenzionalitu je nutné ověřit faktorovou analýzou. Alfa ji prokázat nemůže a nikdy k tomu nebylo určeno.
Neznamená, že je škála validní. Alfa nic neříká o tom, co položky měří. Dvacet otázek o velikosti bot by vykazovalo výbornou vnitřní konzistenci, ale jako měřítko čehokoli psychologického by mělo nulovou validitu.
Neznamená, že je škála dobrá. Protože alfa roste s počtem položek, dlouhá škála průměrných položek dosáhne vyšší hodnoty než krátká škála výborných položek. Škála se čtyřiceti položkami a průměrnou korelací mezi položkami 0,2 dosáhne hodnoty přes 0,90.
Velmi vysoké alfa bývá varovným signálem. Nad přibližně 0,95 jsou položky obvykle téměř jen různými formulacemi téhož. Konzistence je pak vykoupena užším pokrytím konstruktu: škála velmi přesně měří jednu úzkou fasetu, ale zbytek konstruktu opomíjí. Tomu se říká paradox atenuace a právě proto neplatí, že čím vyšší konzistence, tím lépe.
Z jakých předpokladů vychází
Alfa představuje dolní mez reliability za určitého předpokladu: tau-ekvivalence, tedy že každá položka přispívá ke zjišťování základního rysu stejnou měrou. Skutečné škály tento předpoklad téměř nikdy nesplňují. Položky se liší silou své vazby na faktor, a pokud se liší, alfa reliabilitu podhodnocuje.
McDonaldovo omega předpoklad stejného přínosu položek nevyžaduje a odhaduje reliabilitu ze skutečných faktorových zátěží. Metodologové ho už dvě desetiletí doporučují místo alfy. Praxe ve vykazování výsledků se mění pomalu, především proto, že alfu vypočítá jediný příkaz v každém statistickém programu, zatímco u omegy to tak není.
Jak alfu číst v praxi
Orientační zvyklosti: hodnota 0,70 a vyšší je přijatelná pro výzkum porovnávající skupiny, 0,80 a vyšší pro praktické použití a 0,90 a vyšší tam, kde skóre ovlivňuje rozhodnutí o jednotlivci. Ber je jako vodítko, ne jako pevné hranice. Požadovaná úroveň závisí na závažnosti rozhodnutí, pro které se skóre používá.
Užitečnější údaje obvykle najdeš jinde v téže studii. Průměrná korelace mezi položkami (zdravé rozmezí je 0,15 až 0,50) ti napoví, zda vysoké alfa plyne z kvality položek, nebo z jejich počtu. Počet položek ti řekne totéž z druhé strany. Reliabilita při opakovaném měření ti ukáže něco, co alfa ze své podstaty ukázat nemůže: zda skóre u téhož člověka zůstává v čase stabilní.
Škála, která uvádí pouze alfu, uvádí ukazatel reliability, který se získává nejsnáze a u něhož je nejsnazší dosáhnout přijatelné hodnoty.
Vyzkoušej to
Číst si o měření je jedna věc. Vidět své vlastní skóre společně s jeho zdrojem, normativním vzorkem a omezeními je něco jiného. Test je zdarma a registrace není nutná.
Pokračovat ve čtení
- Co je psychometrie?Obor, který zjišťuje, zda je psychologické měření kvalitní. Vysvětluje také, proč se dva testy s podobnými otázkami mohou výrazně lišit v hodnotě svých výsledků.
- Co je reliabilita v psychologickém testování?Reliabilita znamená konzistenci měření, ne jeho správnost. Test může mít vysokou reliabilitu, a přesto měřit něco jiného, než má. Proto je reliabilita první otázkou, kterou je třeba položit, ale nikdy ne poslední.
- Co je validita v psychologickém testování?Validita není vlastnost, kterou test má. Jde o argument, zda je určitá interpretace konkrétního skóre pro konkrétní účel obhajitelná, a pro každé nové použití je třeba tento argument znovu vybudovat.
- Co je konstruktová validita?Nejtěžší otázka měření: zda to, co měříš, existuje tak, jak jsi to definoval/a, a zda tvůj nástroj zachycuje právě to, a ne něco příbuzného.
- Konvergentní a diskriminační validitaDva vzájemně zrcadlové požadavky: měření musí odpovídat tomu, čemu by odpovídat mělo, a zároveň se musí odlišovat od toho, čím podle svého tvrzení není. Většina slabých nástrojů nesplňuje druhý požadavek.
- Standardní chyba měření: o kolik se může tvé skóre lišitKaždé skóre má určitou míru chyby a u většiny psychologických testů je větší, než si lidé myslí. Právě tato hodnota ti říká, kdy je rozdíl skutečný a kdy jde jen o šum.
- Normy a percentily: s čím se porovnává tvé skóreHrubé skóre samo o sobě nelze interpretovat. Smysl získává teprve ve vztahu k referenční skupině. To, která skupina byla použita, patří k nejdůležitějším, ale nejméně uváděným informacím o jakémkoli testu.
- Jak se skutečně vytváří psychometrický testOd definice konstruktu po zveřejnění norem trvá celý postup roky a většina původních návrhů neprojde. Když znáš jednotlivé kroky, snadno poznáš, které z nich rychlý online kvíz vynechal.
- Co znamená, když se o testu říká, že byl validován?Toto označení nepodléhá regulaci a volně ho používají produkty, které pro jeho oprávněné použití nic neudělaly. Tady se dozvíš, co znamená, když má skutečný obsah, a které čtyři otázky ti pomohou oba případy rozlišit.
- Proč většina internetových testů osobnosti není reliabilníNe proto, že by byli nepoctiví, ale proto, že kroky, díky nimž je měření důvěryhodné, nejsou vidět, jsou nákladné a dají se snadno vynechat. Když je vynecháš, na vzhledu výsledku se nic nezmění.
- Co může a nemůže měřit sebehodnoceníDotazníky tě žádají, abys pozoroval/a sám/sama sebe. U některých věcí to funguje lépe než u jiných. Když víš, v čem je tato metoda silná a kde selhává, mění to způsob, jakým čteš každý výsledek.
- Co znamená, když test něco předpovídáKorelace 0,30 je ve výzkumu osobnosti významným zjištěním, ale slabým základem pro rozhodnutí o jednom člověku. Obě tvrzení jsou pravdivá a rozdíl mezi nimi vede k většině případů nesprávného použití výsledků testů.
- Screening není diagnózaScreeningový dotazník je navržen tak, aby zachytil co nejvíce možných případů, i za cenu vysokého podílu falešně pozitivních výsledků. Považovat skóre ze screeningu za diagnózu znamená připisovat mu účel, pro který nebylo určeno.