Konvergentní a diskriminační validita
Dva vzájemně zrcadlové požadavky: měření musí odpovídat tomu, čemu by odpovídat mělo, a zároveň se musí odlišovat od toho, čím podle svého tvrzení není. Většina slabých nástrojů nesplňuje druhý požadavek.
Konvergentní a diskriminační validita jsou dvě stránky téhož požadavku. Měřicí nástroj musí korelovat s tím, s čím by podle teorie korelovat měl, a nesmí příliš silně korelovat s tím, od čeho se má lišit. Splnění jednoho bez druhého není částečný úspěch; obvykle je to známka toho, že konstrukt není tím, za co se vydává.
Konvergentní validita
Důkazy konvergentní validity ukazují, že měřicí nástroj odpovídá jiným ukazatelům téhož jevu. Nová škála úzkosti by měla výrazně korelovat se zavedenými škálami úzkosti, s hodnocením odborníků a v ideálním případě i s něčím, co není dalším dotazníkem, například s fyziologickými měřeními nebo pozorovaným vyhýbavým chováním.
Obvykle se zde očekávají korelace vyšší než 0,50, často vyšší než 0,70, pokud je srovnávacím nástrojem dobře zavedený nástroj pro měření téhož konstruktu. Při nižších hodnotách měří buď nová škála, nebo srovnávací nástroj něco jiného.
Je tu ale háček. Korelace 0,95 s existující škálou není triumf; znamená to, že nový nástroj jen předkládá totéž v jiném obalu, a poctivá otázka pak zní, co přináší navíc. Konvergentní validita je minimální hranice, ne cíl, který je třeba maximalizovat.
Diskriminační validita
Důkazy diskriminační validity ukazují, že měřicí nástroj zůstává odlišný od konstruktů, od nichž se podle svého vymezení liší. Právě tady se objevují zajímavá selhání.
V odborné literatuře se opakuje stejný vzorec. Vytrvalost koreluje se svědomitostí přibližně na úrovni 0,84, což je natolik vysoká hodnota, že metaanalýza zjistila, že po zohlednění svědomitosti přidává k predikci studijních výsledků téměř nic. Emoční inteligence měřená sebehodnocením se výrazně překrývá s kombinací emoční stability, extraverze a svědomitosti. Společný rozptyl rysů temné triády z velké části mizí, jakmile se zohlední poctivost a pokora z modelu HEXACO. V každém z těchto případů byl konstrukt představen jako nové území, ale ukázalo se, že jde o přejmenovanou oblast již existující mapy.
U diskriminační validity se také projevují vlivy metody měření. Pokud každý sebehodnocený konstrukt ve studii koreluje s každým dalším na úrovni 0,4, společným faktorem je pravděpodobně spíše způsob, jakým respondent odpovídá, než sdílený psychologický základ.
Test, který to rozhodne
Rozhodujícím postupem je ověření inkrementální validity: do regrese se nejprve zahrne zavedený měřicí nástroj, potom nový, a sleduje se, zda nový nástroj vysvětluje nějaký další rozptyl výsledné proměnné. Pokud ne, konstrukt může být stále teoreticky zajímavý, ale nástroj neměří nic, co by obor už neměl k dispozici.
Je to náročné kritérium a velké množství publikovaných škál jím nikdy neprošlo. Když se mu podrobí, výsledkem je často výše popsané zjištění, že jsou nadbytečné. To není skandál; jde o běžné vědecké vytřídění. Znamená to však, že popularita konstruktu nic nevypovídá o tom, zda v tomto testu obstojí.
Co to pro tebe jako čtenáře znamená
Když test uvádí několik skóre, užitečná otázka zní, zda jsou tato skóre skutečně odlišná. Čtyři dimenze, které mezi sebou korelují na úrovni 0,8, jsou jedna dimenze se čtyřmi názvy. Profil z nich vytvořený bude vypadat rozlišeně, přestože ponese téměř nulové množství nezávislých informací.
U nástrojů, které uvádějí korelace mezi svými škálami, si to můžeš ověřit sám či sama. Nástroje, které představují typ založený na čtyřech kvadrantech, aniž by kdy ukázaly, jak spolu kvadranty souvisejí, takové ověření znemožňují. A o to obvykle jde.
Vyzkoušej to
Číst si o měření je jedna věc. Vidět své vlastní skóre společně s jeho zdrojem, normativním vzorkem a omezeními je něco jiného. Test je zdarma a registrace není nutná.
Pokračovat ve čtení
- Co je psychometrie?Obor, který zjišťuje, zda je psychologické měření kvalitní. Vysvětluje také, proč se dva testy s podobnými otázkami mohou výrazně lišit v hodnotě svých výsledků.
- Co je reliabilita v psychologickém testování?Reliabilita znamená konzistenci měření, ne jeho správnost. Test může mít vysokou reliabilitu, a přesto měřit něco jiného, než má. Proto je reliabilita první otázkou, kterou je třeba položit, ale nikdy ne poslední.
- Co je validita v psychologickém testování?Validita není vlastnost, kterou test má. Jde o argument, zda je určitá interpretace konkrétního skóre pro konkrétní účel obhajitelná, a pro každé nové použití je třeba tento argument znovu vybudovat.
- Co je konstruktová validita?Nejtěžší otázka měření: zda to, co měříš, existuje tak, jak jsi to definoval/a, a zda tvůj nástroj zachycuje právě to, a ne něco příbuzného.
- Co je Cronbachovo alfa a co neníNejčastěji uváděná statistika v psychologickém testování a zároveň nejčastěji chybně vykládaná. Alfa ti neřekne, zda je škála jednodimenzionální, a vysoká hodnota je často spíše příznakem problému než předností.
- Standardní chyba měření: o kolik se může tvé skóre lišitKaždé skóre má určitou míru chyby a u většiny psychologických testů je větší, než si lidé myslí. Právě tato hodnota ti říká, kdy je rozdíl skutečný a kdy jde jen o šum.
- Normy a percentily: s čím se porovnává tvé skóreHrubé skóre samo o sobě nelze interpretovat. Smysl získává teprve ve vztahu k referenční skupině. To, která skupina byla použita, patří k nejdůležitějším, ale nejméně uváděným informacím o jakémkoli testu.
- Jak se skutečně vytváří psychometrický testOd definice konstruktu po zveřejnění norem trvá celý postup roky a většina původních návrhů neprojde. Když znáš jednotlivé kroky, snadno poznáš, které z nich rychlý online kvíz vynechal.
- Co znamená, když se o testu říká, že byl validován?Toto označení nepodléhá regulaci a volně ho používají produkty, které pro jeho oprávněné použití nic neudělaly. Tady se dozvíš, co znamená, když má skutečný obsah, a které čtyři otázky ti pomohou oba případy rozlišit.
- Proč většina internetových testů osobnosti není reliabilníNe proto, že by byli nepoctiví, ale proto, že kroky, díky nimž je měření důvěryhodné, nejsou vidět, jsou nákladné a dají se snadno vynechat. Když je vynecháš, na vzhledu výsledku se nic nezmění.
- Co může a nemůže měřit sebehodnoceníDotazníky tě žádají, abys pozoroval/a sám/sama sebe. U některých věcí to funguje lépe než u jiných. Když víš, v čem je tato metoda silná a kde selhává, mění to způsob, jakým čteš každý výsledek.
- Co znamená, když test něco předpovídáKorelace 0,30 je ve výzkumu osobnosti významným zjištěním, ale slabým základem pro rozhodnutí o jednom člověku. Obě tvrzení jsou pravdivá a rozdíl mezi nimi vede k většině případů nesprávného použití výsledků testů.
- Screening není diagnózaScreeningový dotazník je navržen tak, aby zachytil co nejvíce možných případů, i za cenu vysokého podílu falešně pozitivních výsledků. Považovat skóre ze screeningu za diagnózu znamená připisovat mu účel, pro který nebylo určeno.