Hva betyr det når en test kalles validert?
Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
«Vitenskapelig validert» er ikke et beskyttet begrep. Ingen sertifiserer det, ingen instans fører tilsyn med det, og det dukker opp på produkter der hele evidensgrunnlaget er at mange mennesker har tatt dem. Det er verdt å vite hva det betyr når det brukes riktig.
Kortversjonen
Et validert instrument har en publisert dokumentasjon som viser hva det måler, hvor presist, i hvilke populasjoner, og hva skårene legitimt kan brukes til. Validering er ikke et sertifikat. Det er en samling evidens, som regel bygget opp over flere år, og som regel med funn som begrenser bruken av instrumentet i stedet for å smigre det.
At det finnes dokumenterte begrensninger, er et av de bedre tegnene. Ekte valideringslitteratur er full av dem: denne skalaen fungerer dårlig hos ungdom, den fasetten replikeres ikke, grenseverdien avhenger av populasjonen. Et produkt som bare rapporterer styrker, har ikke publisert sin validering; det har publisert sin markedsføring.
Fire spørsmål som gjør jobben
Hva er kildepublikasjonen? Et validert instrument har en originalartikkel i et fagfellevurdert tidsskrift, med forfattere, årstall og som regel en DOI. Artikkelen rapporterer hvordan leddene ble utviklet og hva de første psykometriske egenskapene var. Hvis ingen kan navngi artikkelen, finnes det ingen validering å diskutere.
Ble strukturen bekreftet av noen andre? Utviklerteamet vil gjenfinne strukturen de selv utformet. Det som teller, er om en uavhengig gruppe, med uavhengige data, fant det samme. Dette er det mest informative spørsmålet du kan stille, og det som oftest forblir ubesvart.
Hvilken populasjon ble normene bygget på, og når? En skår er en posisjon i en referansefordeling. Et instrument som oppgir en persentil uten å si hvilken populasjon den viser til, har gitt deg et tall uten nevner.
Hva tilfører det? Inkrementell validitet utover et etablert mål. Svært mange merkevarebaserte konstrukter faller igjennom her, fordi de korrelerer så sterkt med et eksisterende trekk at de ikke forklarer noen ekstra varians i noe som helst. Dette er et normalt utfall av vitenskapelig gransking, og det er usynlig med mindre noen faktisk gjør testen.
Der oversettelse kompliserer det
Et instrument som er validert på engelsk, er ikke dermed validert på tysk. Skikkelig kulturell tilpasning krever oversettelse og tilbakeoversettelse, ekspertvurdering, kognitive intervjuer og deretter en ny psykometrisk studie på det nye språket som tester om faktorstrukturen holder, og om de enkelte leddene fungerer likt på tvers av grupper.
Instrumenter som hopper over dette, er vanlige. Et spørreskjema med en upåklagelig opprinnelig validering kan oppføre seg ganske annerledes på et språk der et sentralt ledd har en annen konnotasjon, og det er ingen måte å vite det på uten studien. Når en test tilbys på ti språk, er det nyttige spørsmålet om den ble validert på ti språk, eller validert på ett og oversatt til ni.
Hva validering ikke gir deg
Den gjør ikke en skår sikker. Et validert instrument har fortsatt målefeil, beskriver fortsatt en regelmessighet på populasjonsnivå snarere enn en individuell skjebne, og måler fortsatt bare det leddene når.
Det validering gir deg, er kjente grenser. Du kan finne ut hvor mye feil, i hvilken populasjon og til hvilket formål. Det er en mindre påstand enn «denne testen avslører hvem du egentlig er», og det er den eneste som holder.
Hvis du vil se hvordan dokumentasjonen ser ut når den finnes, oppgir hver test i NOESIS-testkatalogen hvilket instrument den bygger på, forfatterne og årstallet, skåringsmetoden og evidensen bak den, inkludert der evidensen er omstridt.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.
- Screening er ikke diagnoseEt screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.