Što je valjanost u psihološkom testiranju?
Valjanost nije svojstvo koje test posjeduje. To je argument o tome je li određena interpretacija određenog rezultata, za određenu svrhu, opravdana; i taj argument treba iznova izgraditi za svaku novu primjenu.
Valjanost se pita mjeri li test ono što tvrdi da mjeri i jesu li zaključci koje ljudi izvode iz njegovih rezultata opravdani. To je središnje pitanje psihometrije i ono na koje se najčešće odgovara marketinškom tvrdnjom umjesto dokazima.
Suvremeno shvaćanje, koje vrijedi još od Messickova rada iz 1980-ih, jest da valjanost nije stalno svojstvo instrumenta. Ona je svojstvo interpretacije rezultata za određenu namjenu. Isti upitnik može biti dobro validiran za opisivanje nečije samopercepcije, a potpuno nevalidiran za odlučivanje o tome hoćeš li tu osobu zaposliti. Reći "ovaj test je valjan", a ne reći za što je valjan, nije tvrdnja; to je slogan.
Vrste dokaza
Valjanost se gradi iz nakupljenih dokaza nekoliko vrsta. Stariji tekstovi ih prikazuju kao zasebne vrste valjanosti; današnji pogled ih tretira kao različite argumente koji podupiru jedan slučaj.
Dokazi o sadržaju pitaju pokrivaju li čestice konstrukt na odgovarajući način. Ljestvica depresije koja pita samo o spavanju i apetitu pokriva somatske simptome, a propušta one vezane uz raspoloženje i kogniciju. Pokrivenost sadržaja obično procjenjuju stručnjaci za određeno područje i to je razlog zašto su vrlo kratke ljestvice uvijek kompromis.
Dokazi o unutarnjoj strukturi pitaju grupiraju li se čestice onako kako teorija kaže da bi trebale. Ako model tvrdi da postoje četiri zasebne facete, faktorska analiza trebala bi izdvojiti četiri faktora, i to, što je ključno, na nezavisnom uzorku, a ne samo na onom na kojem je ljestvica izrađena. Velik broj instrumenata reproducira svoju zamišljenu strukturu na razvojnom uzorku, a ne uspijeva u tome ni na jednom drugom.
Odnosi s drugim varijablama područje je u kojem se odvija najveći dio posla. Konvergentni dokazi pokazuju da ljestvica korelira s onim s čime bi trebala korelirati. Diskriminantni dokazi pokazuju da ne korelira previsoko s onim od čega bi se trebala razlikovati; to je zahtjev koji se kronično zanemaruje i upravo onaj koji obara mnoge novo brendirane konstrukte. Kriterijski dokazi pokazuju da je rezultat povezan s ishodom koji je važan, bilo da se mjeri u isto vrijeme ili predviđa unaprijed.
Dokazi o posljedicama pitaju što se događa kad se test primjenjuje. Ako instrument sustavno stavlja neku skupinu u nepovoljan položaj iz razloga koji nisu povezani s konstruktom, to je problem valjanosti, a ne samo etički problem.
Pitanje koje razotkriva većinu tvrdnji
Najoštrija provjera tvrdnje o valjanosti jest inkrementalna valjanost: dodaje li ovaj instrument išta onome što ti već govori jeftinija, starija, etablirana mjera?
Upadljivo velik broj brendiranih konstrukata ovdje pada. Koreliraju 0,7 ili više s nekom postojećom domenom Velikih pet, predviđaju iste ishode u istoj mjeri i ne dodaju ništa kad se starija mjera statistički kontrolira. Konstrukt je nov; mjerenje nije. Zato se odjeljci s kritikama u ozbiljnoj dokumentaciji instrumenata tako često vrte oko redundancije, a ne netočnosti.
Na što obratiti pozornost
Kad netko tvrdi da je test validiran, korisna su pitanja konkretna. Validiran prema kojem kriteriju? Na kojoj populaciji i kolikom uzorku? Je li faktorska struktura potvrđena na nezavisnom uzorku? Postoje li objavljeni dokazi istraživača bez komercijalnog interesa za odgovor? Dodaje li išta u odnosu na etabliranu alternativu?
Instrument koji na ta pitanja ima iskrene odgovore vrijedi shvatiti ozbiljno, uključujući njegova ograničenja. Instrument čija se validacija sastoji od stranice s preporukama i tvrdnje da ga je riješilo milijune ljudi odgovorio je na posve drugo pitanje: popularnost nije dokaz, a broj ljudi koji su riješili test ne govori ništa o tome znače li njegovi rezultati išta.
Provjeri na testu
Čitati o mjerenju jedno je. Vidjeti vlastiti rezultat prikazan s izvorom, normativnim uzorkom i ograničenjima nešto je drugo. Besplatno, bez registracije.
Nastavi čitati
- Što je psihometrija?Disciplina koja utvrđuje je li neko psihološko mjerenje uopće dobro. Ujedno i razlog zašto se dva testa sa sličnim pitanjima mogu golemo razlikovati u tome koliko njihovi rezultati vrijede.
- Što je pouzdanost u psihološkom testiranju?Pouzdanost je dosljednost mjerenja, a ne točnost. Test može biti vrlo pouzdan, a ipak mjeriti pogrešnu stvar. Zato je to prvo pitanje koje se postavlja, a nikad posljednje.
- Što je konstruktna valjanost?Najteže pitanje u mjerenju: postoji li ono što mjeriš onako kako si ga definirao i dopire li tvoj instrument upravo do toga, a ne do nečega susjednog.
- Konvergentna i diskriminativna valjanostDva zrcalna zahtjeva: mjera se mora slagati s onim s čim bi se trebala slagati i mora ostati različita od onoga što tvrdi da nije. Većina slabih instrumenata ne zadovoljava drugi.
- Što je Cronbachov alfa, a što on nijeNajčešće navođena statistika u psihološkom testiranju i ona koja se najčešće pogrešno tumači. Alfa ti ne govori je li ljestvica jednodimenzionalna, a visoka vrijednost često je simptom, a ne vrlina.
- Standardna pogreška mjerenja: koliko bi tvoj rezultat mogao odstupatiSvaki rezultat nosi određenu pogrešku mjerenja, a kod većine psiholoških testova ona je veća nego što ljudi pretpostavljaju. To je broj koji ti govori kada je razlika stvarna, a kada je samo šum.
- Norme i percentili: s čime se uspoređuje tvoj rezultatSirovi rezultat sam po sebi nije moguće interpretirati. Smisao dobiva tek u usporedbi s referentnom skupinom, a to koja je skupina korištena jedna je od najvažnijih i najmanje isticanih činjenica o bilo kojem testu.
- Kako se psihometrijski test zapravo izrađujeOd definicije konstrukta do objavljenih normi, taj slijed traje godinama i odbacuje većinu onoga što u njega uđe. Kad poznaješ korake, odmah ti je jasno koje je brzi internetski kviz preskočio.
- Što znači kada se za test kaže da je validiran?Ta riječ nije zaštićena i slobodno je koriste proizvodi koji nisu obavili nimalo tog posla. Evo što znači kad doista nešto znači, i četiri pitanja koja razlikuju ta dva slučaja.
- Zašto većina internetskih testova osobnosti nije pouzdanaNe zato što su nepošteni, nego zato što su koraci koji mjerenje čine pouzdanim nevidljivi, skupi i lako ih je preskočiti; a njihovo preskakanje ne mijenja ništa u tome kako rezultat izgleda.
- Što samoprocjena može, a što ne može mjeritiUpitnici traže da budeš promatrač samog sebe, što za neke stvari funkcionira bolje nego za druge. Kad znaš gdje je metoda snažna, a gdje zakazuje, drukčije čitaš svaki rezultat.
- Što znači kada test nešto predviđaKorelacija od 0,30 snažan je nalaz u istraživanjima osobnosti, ali slaba osnova za odluku o jednoj osobi. Obje su tvrdnje točne, a jaz između njih uzrok je većine zlouporaba rezultata testova.
- Probir nije dijagnozaUpitnik za probir osmišljen je tako da otkrije što više mogućih slučajeva, pri čemu je visoka stopa lažno pozitivnih nalaza cijena koja se prihvaća. Čitati rezultat probira kao dijagnozu znači izokrenuti ono za što je osmišljen.