Štandardná chyba merania: o koľko sa tvoje skóre môže odchyľovať
Každé skóre má určitú chybu merania a pri väčšine psychologických testov je väčšia, než si ľudia myslia. Toto je číslo, ktoré ti povie, kedy je rozdiel skutočný a kedy ide len o šum.
Štandardná chyba merania premieňa abstraktný koeficient reliability na niečo konkrétne: pásmo plus mínus okolo skóre. Odpovedá na otázku, ktorú väčšina obrazoviek s výsledkami nechá bez odpovede: o koľko by sa toto číslo mohlo líšiť, keby som test robil/a v iné popoludnie?
Vzorec je jednoduchý. Smerodajnú odchýlku škály vynásobíš druhou odmocninou z rozdielu jedna mínus jej reliabilita. Pri škále so smerodajnou odchýlkou 10 a reliabilitou 0,85 je štandardná chyba približne 3,9 bodu.
Čo to pásmo naozaj pokrýva
Približne v dvoch tretinách prípadov leží skutočná úroveň človeka v rozsahu jednej štandardnej chyby od jeho nameraného skóre. Ak chceš mať istotu približne na 95 percent, potrebuješ zhruba dve štandardné chyby na každú stranu.
Vezmime príklad vyššie. Niekto dosiahne skóre 62. Interval 95 percent siaha približne od 54 do 70. To je šestnásťbodové okno na škále, kde typický rozdiel medzi priemerom a zreteľne nadpriemernou hodnotou môže byť desať bodov.
Nie je to chyba tohto konkrétneho testu. Reliabilita 0,85 je slušná. Je to bežná presnosť psychologického merania a práve preto starostlivo pripravené správy uvádzajú pásma, a nie body.
Dôsledky, ktoré ľudia prehliadajú
Malé rozdiely medzi škálami sú zvyčajne bezvýznamné. Ak máš extraverziu 58 a otvorenosť 54, poctivý výklad je, že sa nedajú rozlíšiť. Interpretácie profilu, ktoré budujú príbeh na štvorbodových rozdieloch, čítajú šum.
Malé zmeny v čase sú zvyčajne tiež bezvýznamné. Ak test zopakuješ a posunieš sa o päť bodov, pri väčšine nástrojov je to v rámci chyby. Skutočná zmena čŕt prebieha počas rokov a prejaví sa ako posun ďaleko za hranicami pásma chyby, nie ako pár bodov z mesiaca na mesiac.
Poradie problém ešte zväčšuje. Rozdiel niekoľkých hrubých bodov môže človeka posunúť o desať percentilových miest v hustom strede rozloženia, pretože tam sa nachádza väčšina ľudí. Percentilové poradie vyzerá presne, no je to najmenej stabilný spôsob, ako vyjadriť skóre.
Presnosť nie je na celej škále rovnaká. Klasická teória testov predpokladá jednu hodnotu chyby pre každé skóre, čo je zjednodušenie. Teória odpovede na položku modeluje chybu zvlášť na každej úrovni črty a takmer vždy je väčšia na krajoch, teda presne tam, kde sa robia najzávažnejšie interpretácie. Veľmi vysoké alebo veľmi nízke skóre je zvyčajne menej presné ako stredné, nie presnejšie.
Prečo poctivé vykazovanie pôsobí menej pôsobivo
Nástroj, ktorý uvádza intervaly spoľahlivosti, pôsobí neurčitejšie ako ten, ktorý uvádza jedno číslo na jedno desatinné miesto. Ten neurčitejší hovorí pravdu. Ten presne vyzerajúci má rovnakú skrytú chybu a rozhodol sa ju neukázať.
Oplatí sa to mať na pamäti, keď porovnávaš vedecky zdokumentovaný test s komerčným produktom, ktorý ťa zaradí do kategórie. Hranica kategórie leží pri konkrétnom skóre a niekto o jeden bod pod ňou a niekto o jeden bod nad ňou sú štatisticky ten istý človek. Označenie typu to úplne zakryje. To je jeden z vážnejších argumentov proti nástrojom založeným na typoch a dôvod, prečo sú vo výskume štandardom spojité skóre s uvedenou chybou.
Vyskúšaj to v teste
Čítať o meraní je jedna vec. Vidieť vlastné skóre spolu s jeho zdrojom, normatívnou vzorkou a obmedzeniami je niečo iné. Zadarmo, bez registrácie.
Čítať ďalej
- Čo je psychometria?Disciplína, ktorá zisťuje, či je psychologické meranie naozaj kvalitné, a dôvod, prečo sa dva testy s podobnými otázkami môžu obrovsky líšiť v tom, akú hodnotu majú ich výsledky.
- Čo je reliabilita v psychologickom testovaní?Reliabilita je konzistencia merania, nie jeho správnosť. Test môže mať vysokú reliabilitu, a pritom merať niečo iné, než má. Preto je to prvá otázka, ktorú si kladieme, a nikdy nie posledná.
- Čo je validita v psychologickom testovaní?Validita nie je vlastnosť, ktorú test má. Je to argument o tom, či je konkrétna interpretácia konkrétneho skóre na konkrétny účel obhájiteľná, a pre každé nové použitie sa musí vybudovať odznova.
- Čo je konštruktová validita?Najťažšia otázka merania: či to, čo meriaš, existuje tak, ako si to definoval, a či tvoj nástroj zachytáva práve to, a nie niečo príbuzné.
- Konvergentná a diskriminačná validitaDve zrkadlové požiadavky: miera sa musí zhodovať s tým, s čím by sa mala zhodovať, a musí zostať odlišná od toho, čím podľa vlastných slov nie je. Väčšina slabých nástrojov zlyháva v tej druhej.
- Čo je Cronbachova alfa a čo ňou nie jeNajčastejšie uvádzaná štatistika v psychologickom testovaní a zároveň najčastejšie nesprávne chápaná. Alfa ti nepovie, že škála je jednodimenzionálna, a vysoká hodnota je často skôr symptómom než prednosťou.
- Normy a percentily: s čím sa tvoje skóre porovnávaHrubé skóre samo osebe nemožno interpretovať. Zmysel nadobúda až v porovnaní s referenčnou skupinou, a to, ktorá skupina bola použitá, je jedným z najzávažnejších a najmenej zdôrazňovaných faktov o akomkoľvek teste.
- Ako sa psychometrický test naozaj vytváraOd definície konštruktu po zverejnené normy trvá tento postup roky a väčšina toho, čo doň vstupuje, sa vyradí. Keď poznáš jednotlivé kroky, je zrejmé, ktoré z nich rýchly online kvíz vynechal.
- Čo znamená, keď sa o teste hovorí, že je validovaný?Toto slovo nie je nijako regulované a voľne ho používajú produkty, ktoré nevykonali nič z potrebnej práce. Tu je, čo znamená, keď naozaj niečo znamená, a štyri otázky, ktoré tieto dva prípady od seba odlíšia.
- Prečo väčšina internetových testov osobnosti nie je reliabilnáNie preto, že by boli nečestní, ale preto, že kroky, vďaka ktorým je meranie dôveryhodné, sú neviditeľné, drahé a ľahko sa dajú vynechať; a ich vynechanie nijako nezmení to, ako výsledok vyzerá.
- Čo sebavýpoveď dokáže a nedokáže meraťDotazníky od teba žiadajú, aby si bol pozorovateľom samého seba, čo pri niektorých veciach funguje lepšie než pri iných. Keď vieš, kde je táto metóda silná a kde zlyháva, zmení to spôsob, akým čítaš akýkoľvek výsledok.
- Čo znamená, keď test niečo predpovedáKorelácia 0,30 je vo výskume osobnosti silným zistením, no slabým základom na rozhodnutie o jednom človeku. Obe tvrdenia sú pravdivé a práve rozdiel medzi nimi spôsobuje väčšinu nesprávneho používania výsledkov testov.
- Skríning nie je diagnózaSkríningový dotazník je skonštruovaný tak, aby zachytil čo najviac možných prípadov, pričom vysoký podiel falošne pozitívnych výsledkov akceptuje ako daň. Ak čítaš skríningové skóre ako diagnózu, obraciaš naruby to, na čo bol navrhnutý.