Co je validita v psychologickém testování?
Validita není vlastnost, kterou test má. Jde o argument, zda je určitá interpretace konkrétního skóre pro konkrétní účel obhajitelná, a pro každé nové použití je třeba tento argument znovu vybudovat.
Validita se ptá, zda test měří to, co tvrdí, že měří, a zda jsou závěry, které lidé z jeho skóre vyvozují, oprávněné. Je to ústřední otázka psychometrie a zároveň ta, na kterou se nejčastěji odpovídá marketingovým tvrzením místo důkazů.
Moderní pojetí, platné od Messickovy práce v 80. letech, říká, že validita není pevnou vlastností nástroje. Je to vlastnost interpretace skóre pro konkrétní použití. Tentýž dotazník může být dobře validovaný pro popis toho, jak člověk vnímá sám sebe, a zcela nevalidovaný pro rozhodnutí, zda ho zaměstnat. Říct "tento test je validní" a neříct, k čemu je validní, není tvrzení; je to slogan.
Druhy důkazů
Validita se buduje z nashromážděných důkazů několika typů. Starší texty je prezentují jako samostatné druhy validity; současný pohled je chápe jako různé argumenty podporující jediný případ.
Důkazy o obsahu se ptají, zda položky konstrukt náležitě pokrývají. Škála deprese, která se ptá jen na spánek a chuť k jídlu, pokrývá somatické příznaky a míjí ty, které se týkají nálady a kognice. Pokrytí obsahu obvykle posuzují odborníci na danou oblast a právě proto jsou velmi krátké škály vždy kompromisem.
Důkazy o vnitřní struktuře se ptají, zda se položky seskupují tak, jak říká teorie. Pokud model tvrdí, že existují čtyři odlišné fasety, faktorová analýza by měla odhalit čtyři faktory, a to zásadně v nezávislém vzorku, ne jen v tom, na kterém byla škála vytvořena. Velké množství nástrojů reprodukuje zamýšlenou strukturu ve vývojovém vzorku a v jakémkoli jiném selže.
Vztahy k dalším proměnným jsou oblastí, kde se odvádí většina práce. Konvergentní důkazy ukazují, že škála koreluje s tím, s čím by korelovat měla. Diskriminační důkazy ukazují, že nekoreluje příliš vysoko s tím, od čeho by měla být odlišná. Jde o chronicky opomíjený požadavek a právě na něm ztroskotá mnoho nově pojmenovaných konstruktů. Kriteriální důkazy ukazují, že skóre souvisí s výsledkem, na kterém záleží, ať už měřeným současně, nebo předpovídaným předem.
Důkazy o důsledcích se ptají, co se stane, když se test použije. Pokud nástroj systematicky znevýhodňuje určitou skupinu z důvodů, které s konstruktem nesouvisejí, jde o problém validity, nejen o problém etický.
Otázka, která odhalí většinu tvrzení
Nejostřejší zkouškou tvrzení o validitě je inkrementální validita: přidává tento nástroj něco navíc k tomu, co ti už řekne levnější, starší a zavedené měřítko?
Pozoruhodné množství značkových konstruktů zde selhává. Korelují na úrovni 0,7 nebo vyšší s některou existující doménou Big Five, předpovídají stejné výsledky ve stejné síle a po statistické kontrole staršího měřítka nepřidávají nic. Konstrukt je nový; měření nikoli. Proto se kritické části seriózní dokumentace nástrojů tak často točí kolem nadbytečnosti, a ne nepřesnosti.
Na co se zaměřit
Když někdo tvrdí, že je test validovaný, užitečné otázky jsou konkrétní. Validovaný vůči jakému kritériu? V jaké populaci a o jaké velikosti? Byla faktorová struktura potvrzena v nezávislém vzorku? Existují publikované důkazy od výzkumníků, kteří nemají na výsledku komerční zájem? Přidává něco navíc oproti zavedené alternativě?
Nástroj, který na tyto otázky odpovídá poctivě, si zaslouží, abys ho bral/a vážně, včetně jeho omezení. Nástroj, jehož validace spočívá ve stránce s referencemi a tvrzení, že ho vyplnily miliony lidí, odpověděl na úplně jinou otázku. Popularita není důkaz a počet lidí, kteří test vyplnili, neříká nic o tom, zda jeho skóre něco znamenají.
Vyzkoušej to
Číst si o měření je jedna věc. Vidět své vlastní skóre společně s jeho zdrojem, normativním vzorkem a omezeními je něco jiného. Test je zdarma a registrace není nutná.
Pokračovat ve čtení
- Co je psychometrie?Obor, který zjišťuje, zda je psychologické měření kvalitní. Vysvětluje také, proč se dva testy s podobnými otázkami mohou výrazně lišit v hodnotě svých výsledků.
- Co je reliabilita v psychologickém testování?Reliabilita znamená konzistenci měření, ne jeho správnost. Test může mít vysokou reliabilitu, a přesto měřit něco jiného, než má. Proto je reliabilita první otázkou, kterou je třeba položit, ale nikdy ne poslední.
- Co je konstruktová validita?Nejtěžší otázka měření: zda to, co měříš, existuje tak, jak jsi to definoval/a, a zda tvůj nástroj zachycuje právě to, a ne něco příbuzného.
- Konvergentní a diskriminační validitaDva vzájemně zrcadlové požadavky: měření musí odpovídat tomu, čemu by odpovídat mělo, a zároveň se musí odlišovat od toho, čím podle svého tvrzení není. Většina slabých nástrojů nesplňuje druhý požadavek.
- Co je Cronbachovo alfa a co neníNejčastěji uváděná statistika v psychologickém testování a zároveň nejčastěji chybně vykládaná. Alfa ti neřekne, zda je škála jednodimenzionální, a vysoká hodnota je často spíše příznakem problému než předností.
- Standardní chyba měření: o kolik se může tvé skóre lišitKaždé skóre má určitou míru chyby a u většiny psychologických testů je větší, než si lidé myslí. Právě tato hodnota ti říká, kdy je rozdíl skutečný a kdy jde jen o šum.
- Normy a percentily: s čím se porovnává tvé skóreHrubé skóre samo o sobě nelze interpretovat. Smysl získává teprve ve vztahu k referenční skupině. To, která skupina byla použita, patří k nejdůležitějším, ale nejméně uváděným informacím o jakémkoli testu.
- Jak se skutečně vytváří psychometrický testOd definice konstruktu po zveřejnění norem trvá celý postup roky a většina původních návrhů neprojde. Když znáš jednotlivé kroky, snadno poznáš, které z nich rychlý online kvíz vynechal.
- Co znamená, když se o testu říká, že byl validován?Toto označení nepodléhá regulaci a volně ho používají produkty, které pro jeho oprávněné použití nic neudělaly. Tady se dozvíš, co znamená, když má skutečný obsah, a které čtyři otázky ti pomohou oba případy rozlišit.
- Proč většina internetových testů osobnosti není reliabilníNe proto, že by byli nepoctiví, ale proto, že kroky, díky nimž je měření důvěryhodné, nejsou vidět, jsou nákladné a dají se snadno vynechat. Když je vynecháš, na vzhledu výsledku se nic nezmění.
- Co může a nemůže měřit sebehodnoceníDotazníky tě žádají, abys pozoroval/a sám/sama sebe. U některých věcí to funguje lépe než u jiných. Když víš, v čem je tato metoda silná a kde selhává, mění to způsob, jakým čteš každý výsledek.
- Co znamená, když test něco předpovídáKorelace 0,30 je ve výzkumu osobnosti významným zjištěním, ale slabým základem pro rozhodnutí o jednom člověku. Obě tvrzení jsou pravdivá a rozdíl mezi nimi vede k většině případů nesprávného použití výsledků testů.
- Screening není diagnózaScreeningový dotazník je navržen tak, aby zachytil co nejvíce možných případů, i za cenu vysokého podílu falešně pozitivních výsledků. Považovat skóre ze screeningu za diagnózu znamená připisovat mu účel, pro který nebylo určeno.