Standardna pogreška mjerenja: koliko bi tvoj rezultat mogao odstupati
Svaki rezultat nosi određenu pogrešku mjerenja, a kod većine psiholoških testova ona je veća nego što ljudi pretpostavljaju. To je broj koji ti govori kada je razlika stvarna, a kada je samo šum.
Standardna pogreška mjerenja pretvara apstraktni koeficijent pouzdanosti u nešto konkretno: raspon plus-minus oko rezultata. Odgovara na pitanje koje većina zaslona s rezultatima ostavlja bez odgovora: koliko bi se taj broj mogao razlikovati da sam test rješavao nekog drugog popodneva?
Formula je jednostavna. Standardnu devijaciju ljestvice pomnožiš s drugim korijenom iz jedan minus njezina pouzdanost. Za ljestvicu sa standardnom devijacijom 10 i pouzdanošću 0,85 standardna pogreška iznosi oko 3,9 bodova.
Što taj raspon zapravo obuhvaća
Otprilike u dvije trećine slučajeva stvarni položaj osobe nalazi se unutar jedne standardne pogreške od njezina opaženog rezultata. Da bi bio oko 95 posto siguran, trebaš otprilike dvije standardne pogreške sa svake strane.
Uzmi gornji primjer. Netko postigne rezultat 62. Interval od 95 posto proteže se otprilike od 54 do 70. To je raspon od šesnaest bodova na ljestvici na kojoj tipična razlika između prosjeka i jasno iznadprosječnog rezultata može iznositi deset bodova.
To nije nedostatak tog konkretnog testa. Pouzdanost od 0,85 je solidna. To je uobičajena preciznost psihološkog mjerenja i razlog zbog kojeg pažljivo izrađena izvješća prikazuju raspone, a ne točke.
Posljedice koje ljudi previde
Male razlike između ljestvica obično ne znače ništa. Ako ti je ekstraverzija 58, a otvorenost 54, iskreno tumačenje glasi da se ne mogu razlikovati. Interpretacije profila koje grade priču na razlikama od četiri boda čitaju šum.
Male promjene tijekom vremena obično također ne znače ništa. Ako ponovno riješiš test i pomakneš se za pet bodova, to je kod većine instrumenata unutar pogreške. Stvarna promjena crte događa se tijekom godina i vidi se kao pomak daleko izvan raspona pogreške, a ne kao nekoliko bodova iz mjeseca u mjesec.
Rangiranje pojačava problem. Razlika od nekoliko sirovih bodova može nekoga pomaknuti za deset percentilnih mjesta u gustoj sredini distribucije, jer se tamo nalazi većina ljudi. Percentilni rangovi izgledaju precizno, a najnestabilniji su način izražavanja rezultata.
Preciznost nije jednaka duž cijele ljestvice. Klasična teorija testova pretpostavlja jednu vrijednost pogreške za svaki rezultat, što je pojednostavljenje. Teorija odgovora na čestice modelira pogrešku zasebno na svakoj razini crte, a ona je gotovo uvijek veća na krajnostima, upravo ondje gdje se donose interpretacije s najvećim posljedicama. Vrlo visok ili vrlo nizak rezultat obično je manje precizan od onoga u sredini, a ne precizniji.
Zašto iskreno izvještavanje izgleda manje dojmljivo
Instrument koji prikazuje intervale pouzdanosti izgleda neodređenije od onoga koji prikazuje jedan broj na jednu decimalu. Onaj neodređeniji govori istinu. Onaj koji izgleda precizno ima istu temeljnu pogrešku i odlučio ju je ne prikazati.
Vrijedi to imati na umu kad uspoređuješ znanstveno dokumentiran test s komercijalnim proizvodom koji te svrstava u kategoriju. Granica kategorije nalazi se na određenom rezultatu, a netko tko je bod ispod nje i netko tko je bod iznad nje statistički su ista osoba. Oznaka tipa to potpuno skriva; to je jedan od ozbiljnijih argumenata protiv instrumenata temeljenih na tipovima i razlog zbog kojeg su kontinuirani rezultati s navedenom pogreškom standard u istraživanjima.
Provjeri na testu
Čitati o mjerenju jedno je. Vidjeti vlastiti rezultat prikazan s izvorom, normativnim uzorkom i ograničenjima nešto je drugo. Besplatno, bez registracije.
Nastavi čitati
- Što je psihometrija?Disciplina koja utvrđuje je li neko psihološko mjerenje uopće dobro. Ujedno i razlog zašto se dva testa sa sličnim pitanjima mogu golemo razlikovati u tome koliko njihovi rezultati vrijede.
- Što je pouzdanost u psihološkom testiranju?Pouzdanost je dosljednost mjerenja, a ne točnost. Test može biti vrlo pouzdan, a ipak mjeriti pogrešnu stvar. Zato je to prvo pitanje koje se postavlja, a nikad posljednje.
- Što je valjanost u psihološkom testiranju?Valjanost nije svojstvo koje test posjeduje. To je argument o tome je li određena interpretacija određenog rezultata, za određenu svrhu, opravdana; i taj argument treba iznova izgraditi za svaku novu primjenu.
- Što je konstruktna valjanost?Najteže pitanje u mjerenju: postoji li ono što mjeriš onako kako si ga definirao i dopire li tvoj instrument upravo do toga, a ne do nečega susjednog.
- Konvergentna i diskriminativna valjanostDva zrcalna zahtjeva: mjera se mora slagati s onim s čim bi se trebala slagati i mora ostati različita od onoga što tvrdi da nije. Većina slabih instrumenata ne zadovoljava drugi.
- Što je Cronbachov alfa, a što on nijeNajčešće navođena statistika u psihološkom testiranju i ona koja se najčešće pogrešno tumači. Alfa ti ne govori je li ljestvica jednodimenzionalna, a visoka vrijednost često je simptom, a ne vrlina.
- Norme i percentili: s čime se uspoređuje tvoj rezultatSirovi rezultat sam po sebi nije moguće interpretirati. Smisao dobiva tek u usporedbi s referentnom skupinom, a to koja je skupina korištena jedna je od najvažnijih i najmanje isticanih činjenica o bilo kojem testu.
- Kako se psihometrijski test zapravo izrađujeOd definicije konstrukta do objavljenih normi, taj slijed traje godinama i odbacuje većinu onoga što u njega uđe. Kad poznaješ korake, odmah ti je jasno koje je brzi internetski kviz preskočio.
- Što znači kada se za test kaže da je validiran?Ta riječ nije zaštićena i slobodno je koriste proizvodi koji nisu obavili nimalo tog posla. Evo što znači kad doista nešto znači, i četiri pitanja koja razlikuju ta dva slučaja.
- Zašto većina internetskih testova osobnosti nije pouzdanaNe zato što su nepošteni, nego zato što su koraci koji mjerenje čine pouzdanim nevidljivi, skupi i lako ih je preskočiti; a njihovo preskakanje ne mijenja ništa u tome kako rezultat izgleda.
- Što samoprocjena može, a što ne može mjeritiUpitnici traže da budeš promatrač samog sebe, što za neke stvari funkcionira bolje nego za druge. Kad znaš gdje je metoda snažna, a gdje zakazuje, drukčije čitaš svaki rezultat.
- Što znači kada test nešto predviđaKorelacija od 0,30 snažan je nalaz u istraživanjima osobnosti, ali slaba osnova za odluku o jednoj osobi. Obje su tvrdnje točne, a jaz između njih uzrok je većine zlouporaba rezultata testova.
- Probir nije dijagnozaUpitnik za probir osmišljen je tako da otkrije što više mogućih slučajeva, pri čemu je visoka stopa lažno pozitivnih nalaza cijena koja se prihvaća. Čitati rezultat probira kao dijagnozu znači izokrenuti ono za što je osmišljen.