Standardní chyba měření: o kolik se může tvé skóre lišit
Každé skóre má určitou míru chyby a u většiny psychologických testů je větší, než si lidé myslí. Právě tato hodnota ti říká, kdy je rozdíl skutečný a kdy jde jen o šum.
Standardní chyba měření převádí abstraktní koeficient reliability na něco konkrétního: interval kolem skóre. Odpovídá na otázku, kterou většina obrazovek s výsledky nechává bez odpovědi: o kolik se toto číslo mohlo lišit, kdybys test absolvoval/a jiné odpoledne?
Vzorec je jednoduchý. Vynásob směrodatnou odchylku škály druhou odmocninou z jedné minus její reliabilita. U škály se směrodatnou odchylkou 10 a reliabilitou 0,85 činí standardní chyba přibližně 3,9 bodu.
Co tento interval skutečně zahrnuje
Přibližně ve dvou třetinách případů leží skutečná úroveň člověka nejvýše jednu standardní chybu od jeho naměřeného skóre. Pro přibližně 95procentní jistotu je potřeba počítat se zhruba dvěma standardními chybami na každou stranu.
Vezmi si předchozí příklad. Někdo dosáhne skóre 62. Interval pro 95procentní jistotu sahá přibližně od 54 do 70. To je rozpětí šestnácti bodů na škále, kde typický rozdíl mezi průměrem a zřetelně nadprůměrným výsledkem může být deset bodů.
Není to vada tohoto konkrétního testu. Reliabilita 0,85 je solidní. Taková je běžná přesnost psychologického měření a právě proto pečlivě zpracované zprávy uvádějí intervaly, nikoli jednotlivé hodnoty.
Důsledky, které lidé přehlížejí
Malé rozdíly mezi škálami obvykle nic neznamenají. Pokud máš v extraverzi skóre 58 a v otevřenosti 54, poctivý závěr je, že se tato skóre nedají rozlišit. Interpretace profilu, které stavějí příběh na čtyřbodových rozdílech, vyvozují závěry ze šumu.
Malé změny v čase obvykle také nic neznamenají. Když test absolvuješ znovu a tvoje skóre se posune o pět bodů, u většiny nástrojů to spadá do chyby měření. Skutečná změna rysu probíhá v průběhu let a projevuje se posunem výrazně přesahujícím interval chyby, nikoli několika body z měsíce na měsíc.
Řazení podle pořadí problém zesiluje. Rozdíl několika bodů hrubého skóre může někoho posunout o deset percentilových pozic v hustě obsazeném středu rozdělení, protože právě tam se nachází většina lidí. Percentilová pořadí vypadají přesně, ale jsou nejméně stabilním způsobem vyjádření skóre.
Přesnost není v celé škále stejná. Klasická testová teorie předpokládá jednu hodnotu chyby pro každé skóre, což je zjednodušení. Teorie odpovědi na položku modeluje chybu zvlášť na každé úrovni rysu a na krajích škály je téměř vždy větší, tedy právě tam, kde vznikají interpretace s nejzávažnějšími důsledky. Velmi vysoké nebo velmi nízké skóre je zpravidla méně přesné než skóre kolem středu, nikoli přesnější.
Proč poctivé uvádění výsledků působí méně přesvědčivě
Nástroj, který uvádí intervaly spolehlivosti, působí méně určitě než nástroj, který uvádí jediné číslo na jedno desetinné místo. Ten méně určitý říká pravdu. Ten zdánlivě přesný má stejnou základní chybu měření a rozhodl se ji neukázat.
Na to je dobré pamatovat při srovnávání vědecky zdokumentovaného testu s komerčním produktem, který tě zařadí do kategorie. Hranice kategorie leží na konkrétním skóre, ale člověk jeden bod pod ní a člověk jeden bod nad ní se statisticky neliší. Označení typu tuto skutečnost zcela zakrývá. To je jeden ze závažnějších argumentů proti nástrojům založeným na typech a důvod, proč jsou ve výzkumu standardem spojitá skóre s uvedenou chybou měření.
Vyzkoušej to
Číst si o měření je jedna věc. Vidět své vlastní skóre společně s jeho zdrojem, normativním vzorkem a omezeními je něco jiného. Test je zdarma a registrace není nutná.
Pokračovat ve čtení
- Co je psychometrie?Obor, který zjišťuje, zda je psychologické měření kvalitní. Vysvětluje také, proč se dva testy s podobnými otázkami mohou výrazně lišit v hodnotě svých výsledků.
- Co je reliabilita v psychologickém testování?Reliabilita znamená konzistenci měření, ne jeho správnost. Test může mít vysokou reliabilitu, a přesto měřit něco jiného, než má. Proto je reliabilita první otázkou, kterou je třeba položit, ale nikdy ne poslední.
- Co je validita v psychologickém testování?Validita není vlastnost, kterou test má. Jde o argument, zda je určitá interpretace konkrétního skóre pro konkrétní účel obhajitelná, a pro každé nové použití je třeba tento argument znovu vybudovat.
- Co je konstruktová validita?Nejtěžší otázka měření: zda to, co měříš, existuje tak, jak jsi to definoval/a, a zda tvůj nástroj zachycuje právě to, a ne něco příbuzného.
- Konvergentní a diskriminační validitaDva vzájemně zrcadlové požadavky: měření musí odpovídat tomu, čemu by odpovídat mělo, a zároveň se musí odlišovat od toho, čím podle svého tvrzení není. Většina slabých nástrojů nesplňuje druhý požadavek.
- Co je Cronbachovo alfa a co neníNejčastěji uváděná statistika v psychologickém testování a zároveň nejčastěji chybně vykládaná. Alfa ti neřekne, zda je škála jednodimenzionální, a vysoká hodnota je často spíše příznakem problému než předností.
- Normy a percentily: s čím se porovnává tvé skóreHrubé skóre samo o sobě nelze interpretovat. Smysl získává teprve ve vztahu k referenční skupině. To, která skupina byla použita, patří k nejdůležitějším, ale nejméně uváděným informacím o jakémkoli testu.
- Jak se skutečně vytváří psychometrický testOd definice konstruktu po zveřejnění norem trvá celý postup roky a většina původních návrhů neprojde. Když znáš jednotlivé kroky, snadno poznáš, které z nich rychlý online kvíz vynechal.
- Co znamená, když se o testu říká, že byl validován?Toto označení nepodléhá regulaci a volně ho používají produkty, které pro jeho oprávněné použití nic neudělaly. Tady se dozvíš, co znamená, když má skutečný obsah, a které čtyři otázky ti pomohou oba případy rozlišit.
- Proč většina internetových testů osobnosti není reliabilníNe proto, že by byli nepoctiví, ale proto, že kroky, díky nimž je měření důvěryhodné, nejsou vidět, jsou nákladné a dají se snadno vynechat. Když je vynecháš, na vzhledu výsledku se nic nezmění.
- Co může a nemůže měřit sebehodnoceníDotazníky tě žádají, abys pozoroval/a sám/sama sebe. U některých věcí to funguje lépe než u jiných. Když víš, v čem je tato metoda silná a kde selhává, mění to způsob, jakým čteš každý výsledek.
- Co znamená, když test něco předpovídáKorelace 0,30 je ve výzkumu osobnosti významným zjištěním, ale slabým základem pro rozhodnutí o jednom člověku. Obě tvrzení jsou pravdivá a rozdíl mezi nimi vede k většině případů nesprávného použití výsledků testů.
- Screening není diagnózaScreeningový dotazník je navržen tak, aby zachytil co nejvíce možných případů, i za cenu vysokého podílu falešně pozitivních výsledků. Považovat skóre ze screeningu za diagnózu znamená připisovat mu účel, pro který nebylo určeno.