Co je reliabilita v psychologickém testování?
Reliabilita znamená konzistenci měření, ne jeho správnost. Test může mít vysokou reliabilitu, a přesto měřit něco jiného, než má. Proto je reliabilita první otázkou, kterou je třeba položit, ale nikdy ne poslední.
Reliabilita vyjadřuje, do jaké míry lze měření opakovat se stejným výsledkem a do jaké míry je výsledek jen šum. Kdyby ses během jedné minuty zvážil/a třikrát a váha ukázala 71, 78 a 66 kilogramů, byla by nespolehlivá a neměl/a bys jak z ní zjistit svou skutečnou hmotnost. Psychologické měření čelí stejnému problému, ale používá mnohem méně přesné nástroje.
U reliability je zásadní pochopit, co netvrdí. Osobní váha, která soustavně ukazuje o osm kilogramů více, je dokonale spolehlivá, ale její údaj je zcela chybný. Reliabilita se týká konzistence; zda číslo znamená to, co má, je samostatná otázka zvaná validita. Reliabilita je pro validitu nezbytná, ale sama o sobě k ní zdaleka nestačí.
Podoby reliability
Vnitřní konzistence zjišťuje, zda jsou položky škály ve vzájemném souladu. Pokud má všech deset otázek měřit stejný základní rys, lidé s vysokou odpovědí na jednu z nich by měli mít tendenci odpovídat vysoko i na ostatní. Obvykle se vyjadřuje Cronbachovým alfa nebo, lépe, McDonaldovým omega.
Reliabilita testu při opakování zjišťuje, zda stejný člověk dosáhne podobného skóre při dvou příležitostech. Pro rysy, které mají být ze své podstaty stabilní, je tato podoba nejdůležitější. Zároveň se uvádí nejméně často, protože vyžaduje znovu oslovit stejné účastníky po několika týdnech.
Shoda mezi hodnotiteli je důležitá, když nástroj vyhodnocují lidé, například u klinických rozhovorů, projektivních technik nebo pozorování chování. Zjišťuje, zda dva vyškolení hodnotitelé při posouzení stejného materiálu dospějí ke stejnému závěru.
Reliabilita paralelních forem zjišťuje, zda dvě různé verze téhož testu, vytvořené tak, aby byly rovnocenné, vedou ke stejným skóre. Je důležitá všude tam, kde se test zadává opakovaně a záleží na tom, aby se člověk předem neseznámil s jeho položkami.
Jak číst čísla
Koeficienty reliability nabývají hodnot od 0 do 1. Orientační hranice jsou nepřesné a často se používají nesprávně, ale zhruba platí: hodnota nad 0,90 se vyžaduje tam, kde skóre ovlivňuje život jednotlivce, 0,80 až 0,90 je solidní pro většinu praktických použití, 0,70 až 0,80 je přijatelné pro výzkum a porovnávání skupin a hodnota pod 0,70 znamená, že skóre obsahuje více šumu, než většina závěrů snese.
K těmto hranicím patří dvě výhrady. Zaprvé jde o zvyklosti, nikoli zákony; přijatelná úroveň závisí výhradně na tom, k čemu se skóre použije. Zadruhé velmi vysoké alfa u krátké škály obvykle naznačuje, že položky jsou téměř parafrázemi jedna druhé. To zvyšuje konzistenci na úkor pokrytí konstruktu. Škála deseti otázek, které se jen trochu jinými slovy ptají "máš rád/a pořádek?", bude mít vynikající vnitřní konzistenci, ale zachytí svědomitost jen úzce.
Co to znamená pro tvé skóre
Reliabilita přímo určuje, jak velkou důvěru si zaslouží jediné číslo. Test s reliabilitou 0,85 má natolik velkou chybu měření, že rozdíl několika bodů mezi dvěma lidmi nebo mezi tvým dnešním skóre a skóre z minulého měsíce bude velmi pravděpodobně spíše šum než skutečný rozdíl.
Praktický důsledek je tento: dobrý nástroj uvádí svou reliabilitu, abys věděl/a, jak velká je nejistota kolem tvého skóre. Odborným vyjádřením této nejistoty je standardní chyba měření, která převádí koeficient reliability na rozpětí kolem skóre vyjádřené jako plus nebo minus.
Nástroj, který neuvádí žádný údaj o reliabilitě, tím není přesnější. Jen ti neříká, jak nepřesný je.
Vyzkoušej to
Číst si o měření je jedna věc. Vidět své vlastní skóre společně s jeho zdrojem, normativním vzorkem a omezeními je něco jiného. Test je zdarma a registrace není nutná.
Pokračovat ve čtení
- Co je psychometrie?Obor, který zjišťuje, zda je psychologické měření kvalitní. Vysvětluje také, proč se dva testy s podobnými otázkami mohou výrazně lišit v hodnotě svých výsledků.
- Co je validita v psychologickém testování?Validita není vlastnost, kterou test má. Jde o argument, zda je určitá interpretace konkrétního skóre pro konkrétní účel obhajitelná, a pro každé nové použití je třeba tento argument znovu vybudovat.
- Co je konstruktová validita?Nejtěžší otázka měření: zda to, co měříš, existuje tak, jak jsi to definoval/a, a zda tvůj nástroj zachycuje právě to, a ne něco příbuzného.
- Konvergentní a diskriminační validitaDva vzájemně zrcadlové požadavky: měření musí odpovídat tomu, čemu by odpovídat mělo, a zároveň se musí odlišovat od toho, čím podle svého tvrzení není. Většina slabých nástrojů nesplňuje druhý požadavek.
- Co je Cronbachovo alfa a co neníNejčastěji uváděná statistika v psychologickém testování a zároveň nejčastěji chybně vykládaná. Alfa ti neřekne, zda je škála jednodimenzionální, a vysoká hodnota je často spíše příznakem problému než předností.
- Standardní chyba měření: o kolik se může tvé skóre lišitKaždé skóre má určitou míru chyby a u většiny psychologických testů je větší, než si lidé myslí. Právě tato hodnota ti říká, kdy je rozdíl skutečný a kdy jde jen o šum.
- Normy a percentily: s čím se porovnává tvé skóreHrubé skóre samo o sobě nelze interpretovat. Smysl získává teprve ve vztahu k referenční skupině. To, která skupina byla použita, patří k nejdůležitějším, ale nejméně uváděným informacím o jakémkoli testu.
- Jak se skutečně vytváří psychometrický testOd definice konstruktu po zveřejnění norem trvá celý postup roky a většina původních návrhů neprojde. Když znáš jednotlivé kroky, snadno poznáš, které z nich rychlý online kvíz vynechal.
- Co znamená, když se o testu říká, že byl validován?Toto označení nepodléhá regulaci a volně ho používají produkty, které pro jeho oprávněné použití nic neudělaly. Tady se dozvíš, co znamená, když má skutečný obsah, a které čtyři otázky ti pomohou oba případy rozlišit.
- Proč většina internetových testů osobnosti není reliabilníNe proto, že by byli nepoctiví, ale proto, že kroky, díky nimž je měření důvěryhodné, nejsou vidět, jsou nákladné a dají se snadno vynechat. Když je vynecháš, na vzhledu výsledku se nic nezmění.
- Co může a nemůže měřit sebehodnoceníDotazníky tě žádají, abys pozoroval/a sám/sama sebe. U některých věcí to funguje lépe než u jiných. Když víš, v čem je tato metoda silná a kde selhává, mění to způsob, jakým čteš každý výsledek.
- Co znamená, když test něco předpovídáKorelace 0,30 je ve výzkumu osobnosti významným zjištěním, ale slabým základem pro rozhodnutí o jednom člověku. Obě tvrzení jsou pravdivá a rozdíl mezi nimi vede k většině případů nesprávného použití výsledků testů.
- Screening není diagnózaScreeningový dotazník je navržen tak, aby zachytil co nejvíce možných případů, i za cenu vysokého podílu falešně pozitivních výsledků. Považovat skóre ze screeningu za diagnózu znamená připisovat mu účel, pro který nebylo určeno.