Hvordan en psykometrisk test faktisk utvikles
Fra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
Et psykometrisk instrument som når publisering, har vanligvis vært gjennom fem eller seks års arbeid, og det meste av det som ble skrevet til det, er kastet underveis. Rekkefølgen er verdt å kjenne til, fordi hvert trinn svarer til en måte en test kan komme til kort på.
1. Definer konstruktet
Før noe ledd skrives, må konstruktet spesifiseres så presist at man kan si hva som faller utenfor det. Det betyr en definisjon, en beskrivelse av den dimensjonale strukturen (én dimensjon eller flere, og hvis flere, hvordan de henger sammen) og en eksplisitt redegjørelse for hvilke nærliggende konstrukter det skal være atskilt fra.
Å hoppe over dette trinnet er opphavet til de fleste overflødige instrumenter. En skala bygget på en intuitiv forståelse av et begrep ender som regel opp med å måle et etablert trekk under et nytt navn.
2. Lag en leddbank
Det skrives langt flere ledd enn det som vil overleve, typisk tre til fem ganger det endelige antallet. De hentes fra teori, fra eksisterende instrumenter, fra intervjuer med personer som har erfaringen som beskrives, og fra fageksperter.
På dette trinnet gjennomgås leddbanken med tanke på innholdsdekning (dekker den hele konstruktet, eller samler den seg om én fasett?), lesenivå, dobbelttydige formuleringer som spør om to ting samtidig, og ledd som egentlig spør om noe annet.
3. Pilotér og kutt
Leddbanken gis til et første utvalg. Analysen er stort sett destruktiv.
Ledd nesten uten varians fjernes: et spørsmål alle svarer likt på, skiller ingen fra hverandre. Ledd som korrelerer svakt med totalskåren, fjernes. Ledd som lader på mer enn én faktor, fjernes. Ledd som fungerer ulikt på tvers av demografiske grupper av grunner som ikke har med trekket å gjøre (differensiell leddfunksjon), fjernes, og denne kontrollen er en av dem som oftest hoppes over.
Det som overlever, er typisk en tredjedel av det som ble skrevet.
4. Bekreft strukturen i et nytt utvalg
Dette er trinnet som skiller seriøse instrumenter fra resten. Faktoranalyse på utviklingsutvalget vil gjenfinne strukturen som ble designet inn; det må den, siden leddene ble valgt ut for å frembringe den. Den egentlige testen er bekreftende faktoranalyse i et uavhengig utvalg.
Svært mange publiserte skalaer gjenfinner den tiltenkte strukturen bare i dataene som ble brukt til å bygge dem. Når noen andre samler inn nye data, dukker ikke faktorene opp. Denne svikten er så vanlig at «ble strukturen bekreftet i et uavhengig utvalg?» er et av de mest effektive spørsmålene man kan stille om et instrument.
5. Samle evidens for validitet
Korrelasjoner med etablerte mål på det samme konstruktet. Korrelasjoner med konstrukter det skal være atskilt fra, som helst bør være lavere. Sammenhenger med utfall som betyr noe. Inkrementell validitet utover det som allerede finnes. Test-retest-stabilitet over et intervall som passer konstruktet.
Dette trinnet tar aldri slutt. Det fortsetter så lenge instrumentet er i bruk, og det er her instrumenter oftest viser seg å komme til kort, år etter publisering.
6. Bygg normer
Et referanseutvalg som er stort nok og representativt nok for den tiltenkte populasjonen, stratifisert der trekket varierer med alder eller kjønn, og dokumentert med år og land. Deretter gjentatt med jevne mellomrom, fordi normer forskyver seg.
7. Oversett, hvis det skal brukes andre steder
Oversettelse er ikke en språklig øvelse. Skikkelig tilpasning betyr oversettelse til målspråket, uavhengig tilbakeoversettelse, ekspertgjennomgang, kognitive intervjuer med personer som snakker målspråket, og deretter en ny psykometrisk studie på det nye språket for å teste om strukturen holder og om leddene fungerer likeverdig. Et instrument som er oversatt uten en slik studie, er et utestet instrument på det språket, uansett hvilke kvalifikasjoner det har på originalspråket.
Hva dette betyr for den raske quizen
En test som er skrevet på en ettermiddag, har fullført trinn to. Den kan godt gi et resultat som ser troverdig ut, en persentil og et avsnitt med beskrivelse. Trinnene den hoppet over, er nettopp de som ville ha avgjort om noe av dette betyr noe som helst.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.