Jak se skutečně vytváří psychometrický test
Od definice konstruktu po zveřejnění norem trvá celý postup roky a většina původních návrhů neprojde. Když znáš jednotlivé kroky, snadno poznáš, které z nich rychlý online kvíz vynechal.
Psychometrický nástroj, který se dostane až k publikaci, má za sebou obvykle pět nebo šest let práce a většina položek, které pro něj byly napsány, byla vyřazena. Stojí za to tento postup znát, protože každá jeho fáze odpovídá jednomu způsobu, jakým může být test nedostatečný.
1. Vymezit konstrukt
Než se napíše jakákoli položka, musí být konstrukt vymezen natolik přesně, aby bylo možné říct, co do něj nepatří. To znamená definici, popis dimenzionální struktury: zda má jednu dimenzi, nebo několik, a pokud několik, jak spolu souvisejí; a výslovné vysvětlení, od kterých příbuzných konstruktů se má lišit.
Vynechání této fáze stojí za vznikem většiny nadbytečných nástrojů. Škála vytvořená na základě intuitivní představy o pojmu obvykle nakonec měří již známý rys pod novým názvem.
2. Vytvořit soubor položek
Položek se připraví výrazně víc, než jich zůstane: obvykle troj- až pětinásobek konečného počtu. Vycházejí z teorie, existujících nástrojů, rozhovorů s lidmi, kteří mají popisovanou zkušenost, a od odborníků na danou oblast.
V této fázi se soubor posuzuje z hlediska pokrytí obsahu (postihuje celý konstrukt, nebo se soustředí na jednu fasetu?), náročnosti textu, formulací, které se ptají na dvě věci najednou, a položek, které se ve skutečnosti ptají na něco jiného.
3. Pilotně ověřit a vyřazovat
Soubor dostane první vzorek respondentů. Analýza spočívá hlavně ve vyřazování.
Položky s téměř nulovou variabilitou se vyřadí: otázka, na kterou všichni odpovídají stejně, nikoho nerozliší. Vyřadí se položky, které slabě korelují s celkovým skóre. Vyřadí se položky, které se vážou k více než jednomu faktoru. Vyřadí se také položky, které se v demografických skupinách chovají odlišně z důvodů nesouvisejících s daným rysem; jde o diferenciální fungování položek a právě tato kontrola se vynechává nejčastěji.
Obvykle zůstane třetina napsaných položek.
4. Potvrdit strukturu na novém vzorku
Tento krok odlišuje důkladně vyvinuté nástroje od ostatních. Faktorová analýza na vzorku použitém při vývoji odhalí strukturu, na kterou byl nástroj sestaven: musí ji odhalit, protože položky byly vybrány právě tak, aby ji vytvářely. Skutečnou zkouškou je konfirmační faktorová analýza na nezávislém vzorku.
U mnoha publikovaných škál se zamýšlená struktura objeví jen v datech použitých při jejich vývoji. Když někdo jiný shromáždí nová data, faktory se neobjeví. K tomuto selhání dochází natolik často, že otázka "Byla struktura potvrzena na nezávislém vzorku?" patří k nejúčinnějším otázkám, které lze o jakémkoli nástroji položit.
5. Shromažďovat důkazy o validitě
Korelace se zavedenými měřítky téhož konstruktu. Korelace s konstrukty, od nichž se má lišit; ty by měly být nižší. Vztahy k důležitým výsledkům. Inkrementální validita oproti tomu, co již existuje. Stabilita při opakovaném měření po intervalu odpovídajícím danému konstruktu.
Tato fáze nekončí. Pokračuje po celou dobu používání nástroje a právě v ní se u nástrojů často až několik let po publikaci ukáže, že neobstojí.
6. Vytvořit normy
Referenční vzorek dostatečně velký a reprezentativní pro cílovou populaci, členěný tam, kde se rys liší podle věku nebo pohlaví, s doloženým rokem a zemí sběru dat. Normy je pak třeba pravidelně aktualizovat, protože se v čase mění.
7. Přeložit, pokud se bude používat jinde
Překlad není jen jazykový úkol. Řádná adaptace zahrnuje překlad do cílového jazyka, nezávislý zpětný překlad, odborné posouzení, kognitivní rozhovory s mluvčími cílového jazyka a následně novou psychometrickou studii v tomto jazyce, která ověří, zda struktura platí a zda položky fungují rovnocenně. Nástroj přeložený bez takové studie je v daném jazyce neověřeným nástrojem, bez ohledu na jeho kvality v původním jazyce.
Co z toho plyne pro rychlý kvíz
Test napsaný za jedno odpoledne prošel druhým krokem. Může klidně nabídnout zdánlivě věrohodný výsledek, percentil a odstavec s popisem. Vynechal však kroky, které by ukázaly, zda cokoli z toho něco znamená.
Vyzkoušej to
Číst si o měření je jedna věc. Vidět své vlastní skóre společně s jeho zdrojem, normativním vzorkem a omezeními je něco jiného. Test je zdarma a registrace není nutná.
Pokračovat ve čtení
- Co je psychometrie?Obor, který zjišťuje, zda je psychologické měření kvalitní. Vysvětluje také, proč se dva testy s podobnými otázkami mohou výrazně lišit v hodnotě svých výsledků.
- Co je reliabilita v psychologickém testování?Reliabilita znamená konzistenci měření, ne jeho správnost. Test může mít vysokou reliabilitu, a přesto měřit něco jiného, než má. Proto je reliabilita první otázkou, kterou je třeba položit, ale nikdy ne poslední.
- Co je validita v psychologickém testování?Validita není vlastnost, kterou test má. Jde o argument, zda je určitá interpretace konkrétního skóre pro konkrétní účel obhajitelná, a pro každé nové použití je třeba tento argument znovu vybudovat.
- Co je konstruktová validita?Nejtěžší otázka měření: zda to, co měříš, existuje tak, jak jsi to definoval/a, a zda tvůj nástroj zachycuje právě to, a ne něco příbuzného.
- Konvergentní a diskriminační validitaDva vzájemně zrcadlové požadavky: měření musí odpovídat tomu, čemu by odpovídat mělo, a zároveň se musí odlišovat od toho, čím podle svého tvrzení není. Většina slabých nástrojů nesplňuje druhý požadavek.
- Co je Cronbachovo alfa a co neníNejčastěji uváděná statistika v psychologickém testování a zároveň nejčastěji chybně vykládaná. Alfa ti neřekne, zda je škála jednodimenzionální, a vysoká hodnota je často spíše příznakem problému než předností.
- Standardní chyba měření: o kolik se může tvé skóre lišitKaždé skóre má určitou míru chyby a u většiny psychologických testů je větší, než si lidé myslí. Právě tato hodnota ti říká, kdy je rozdíl skutečný a kdy jde jen o šum.
- Normy a percentily: s čím se porovnává tvé skóreHrubé skóre samo o sobě nelze interpretovat. Smysl získává teprve ve vztahu k referenční skupině. To, která skupina byla použita, patří k nejdůležitějším, ale nejméně uváděným informacím o jakémkoli testu.
- Co znamená, když se o testu říká, že byl validován?Toto označení nepodléhá regulaci a volně ho používají produkty, které pro jeho oprávněné použití nic neudělaly. Tady se dozvíš, co znamená, když má skutečný obsah, a které čtyři otázky ti pomohou oba případy rozlišit.
- Proč většina internetových testů osobnosti není reliabilníNe proto, že by byli nepoctiví, ale proto, že kroky, díky nimž je měření důvěryhodné, nejsou vidět, jsou nákladné a dají se snadno vynechat. Když je vynecháš, na vzhledu výsledku se nic nezmění.
- Co může a nemůže měřit sebehodnoceníDotazníky tě žádají, abys pozoroval/a sám/sama sebe. U některých věcí to funguje lépe než u jiných. Když víš, v čem je tato metoda silná a kde selhává, mění to způsob, jakým čteš každý výsledek.
- Co znamená, když test něco předpovídáKorelace 0,30 je ve výzkumu osobnosti významným zjištěním, ale slabým základem pro rozhodnutí o jednom člověku. Obě tvrzení jsou pravdivá a rozdíl mezi nimi vede k většině případů nesprávného použití výsledků testů.
- Screening není diagnózaScreeningový dotazník je navržen tak, aby zachytil co nejvíce možných případů, i za cenu vysokého podílu falešně pozitivních výsledků. Považovat skóre ze screeningu za diagnózu znamená připisovat mu účel, pro který nebylo určeno.