noesisnoesis
Ako funguje meranie

Čo je validita v psychologickom testovaní?

Validita nie je vlastnosť, ktorú test má. Je to argument o tom, či je konkrétna interpretácia konkrétneho skóre na konkrétny účel obhájiteľná, a pre každé nové použitie sa musí vybudovať odznova.

Validita sa pýta, či test meria to, čo tvrdí, že meria, a či sú závery, ktoré ľudia vyvodzujú z jeho skóre, opodstatnené. Je to ústredná otázka psychometrie a zároveň tá, na ktorú sa najčastejšie odpovedá marketingovým tvrdením namiesto dôkazov.

Moderné chápanie, platné od Messickovej práce v 80. rokoch, hovorí, že validita nie je pevná vlastnosť nástroja. Je to vlastnosť interpretácie skóre pre konkrétne použitie. Ten istý dotazník môže byť dobre validovaný na opis toho, ako človek vníma sám seba, a úplne nevalidovaný na rozhodovanie, či ho prijať do práce. Povedať "tento test je validný" bez toho, aby si povedal, na čo je validný, nie je tvrdenie; je to slogan.

Druhy dôkazov

Validita sa buduje z nahromadených dôkazov viacerých typov. Staršie texty ich uvádzajú ako samostatné druhy validity; súčasný pohľad ich chápe ako rôzne argumenty podporujúce jeden celok.

Dôkazy o obsahu sa pýtajú, či položky dostatočne pokrývajú konštrukt. Škála depresie, ktorá sa pýta len na spánok a chuť do jedla, pokrýva somatické príznaky, ale vynecháva tie, ktoré sa týkajú nálady a kognície. Pokrytie obsahu zvyčajne posudzujú odborníci na danú oblasť a práve preto sú veľmi krátke škály vždy kompromisom.

Dôkazy o vnútornej štruktúre sa pýtajú, či sa položky zoskupujú tak, ako hovorí teória. Ak model tvrdí, že existujú štyri odlišné aspekty, faktorová analýza by mala odhaliť štyri faktory, a to podstatne na nezávislej vzorke, nielen na tej, na ktorej bola škála vytvorená. Veľmi veľa nástrojov odhalí zamýšľanú štruktúru na vývojovej vzorke, no na akejkoľvek inej zlyhá.

Vzťahy k iným premenným sú oblasťou, kde sa odohráva väčšina práce. Konvergentné dôkazy ukazujú, že škála koreluje s tým, s čím by korelovať mala. Diskriminačné dôkazy ukazujú, že nekoreluje príliš vysoko s tým, od čoho by sa mala odlišovať; ide o požiadavku, ktorá sa chronicky zanedbáva a na ktorej stroskotá množstvo novo pomenovaných konštruktov. Kriteriálne dôkazy ukazujú, že skóre súvisí s výsledkom, na ktorom záleží, či už meraným v rovnakom čase, alebo predpovedaným vopred.

Dôkazy o dôsledkoch sa pýtajú, čo sa stane, keď sa test použije. Ak nástroj systematicky znevýhodňuje určitú skupinu z dôvodov nesúvisiacich s konštruktom, je to problém validity, nielen etický problém.

Otázka, ktorá odhalí väčšinu tvrdení

Najostrejšou skúškou tvrdenia o validite je inkrementálna validita: pridáva tento nástroj niečo k tomu, čo ti už povie lacnejšia, staršia a zavedená miera?

Pozoruhodne veľa značkových konštruktov tu zlyhá. Korelujú na úrovni 0,7 alebo vyššej s existujúcou doménou Big Five, predpovedajú tie isté výsledky v rovnakej miere a po štatistickej kontrole staršej miery nepridávajú nič. Konštrukt je nový; meranie nie. Preto sa kritické časti seriózne dokumentácie nástrojov tak často točia okolo nadbytočnosti, a nie nepresnosti.

Na čo sa zamerať

Keď niekto tvrdí, že test je validovaný, užitočné otázky sú konkrétne. Validovaný oproti akému kritériu? Na akej populácii a akej veľkej? Bola faktorová štruktúra potvrdená na nezávislej vzorke? Existujú publikované dôkazy od výskumníkov, ktorí nemajú na výsledku komerčný záujem? Pridáva niečo oproti zavedenej alternatíve?

Nástroj s úprimnými odpoveďami na tieto otázky stojí za to brať vážne, a to vrátane jeho obmedzení. Nástroj, ktorého validácia pozostáva zo stránky s referenciami a z tvrdenia, že ho absolvovali milióny ľudí, odpovedal na úplne inú otázku: popularita nie je dôkaz a počet ľudí, ktorí test absolvovali, nehovorí nič o tom, či jeho skóre niečo znamenajú.

Vyskúšaj to v teste

Čítať o meraní je jedna vec. Vidieť vlastné skóre spolu s jeho zdrojom, normatívnou vzorkou a obmedzeniami je niečo iné. Zadarmo, bez registrácie.

Čítať ďalej