Screening er ikke diagnose
Et screeningspørreskjema er laget for å fange opp så mange mulige tilfeller som mulig, og aksepterer en høy andel falske positive som prisen for dette. Å lese en screeningskår som en diagnose snur opp ned på det skjemaet ble utformet for å gjøre.
Et spørreskjema for screening av depresjon, et screeningverktøy for angst, et screeningverktøy for alkoholbruk: dette er blant de best validerte instrumentene som finnes, og de blir rutinemessig feiltolket. En skår over grenseverdien betyr ikke at du har tilstanden. Det var aldri meningen.
Avveiningen i utformingen
Ethvert screeninginstrument bygger på en avveining mellom to feil: å overse personer som har tilstanden, og å flagge personer som ikke har den. Screeningverktøy er bevisst innstilt mot den andre feilen. Å overse et tilfelle av depresjon i primærhelsetjenesten er kostbart; et falskt positivt resultat koster en samtale med en kliniker.
Konsekvensen følger aritmetisk. Et screeningverktøy med 88 prosent sensitivitet og 85 prosent spesifisitet høres utmerket ut. Bruk det i en populasjon der 5 prosent faktisk har tilstanden, og av hver 100 personer som screener positivt, har omtrent 74 den ikke. Instrumentet fungerer nøyaktig som spesifisert. De fleste positive resultatene er likevel falske.
Dette er basisratearitmetikk, og det er grunnen til at universell screening i settinger med lav prevalens er omstridt, selv for godt validerte instrumenter.
Hva en grenseverdi er
En grenseverdi er en beslutningsterskel valgt for et formål i en populasjon, ikke en naturlig grense. Den konvensjonelle grenseverdien på 10 for PHQ-9 ble utledet i populasjoner med relativt høy prevalens; brukt andre steder oppfører den seg annerledes. Metaanalyse av individuelle deltakerdata har vist at publiserte estimater av treffsikkerheten for denne grenseverdien var systematisk oppblåst på grunn av selektiv rapportering av optimaliserte terskler.
For noen instrumenter finnes det bevisst ingen universell grenseverdi i det hele tatt. Verdens helseorganisasjons SRQ-20 brukes i dusinvis av land, og den optimale terskelen varierer så mye etter land, språk og kjønn at det å publisere ett globalt tall ville gjort mer skade enn å overlate det til lokal validering.
Diagnose er en annen prosedyre
En diagnose krever at en kliniker fastslår forekomst og varighet av symptomer, deres funksjonelle konsekvenser og utelukkelse av alternative forklaringer: medisinske tilstander, rusmidler, andre lidelser som viser seg på lignende måte. Den tar hensyn til historikk og kontekst. Et spørreskjema gjør ingenting av dette. Det teller selvrapportert symptomhyppighet over en tidsperiode.
To personer kan få identiske skårer ut fra helt ulike kliniske bilder, siden totalskåren komprimerer flere heterogene symptomer til ett tall. Skåren er et signal om å undersøke nærmere; undersøkelsen er diagnosen.
Hva skåren med rette kan brukes til
En oppfordring. En høy skår er en grunn til å snakke med en fagperson. Det er den tiltenkte bruken, og den er virkelig verdifull.
Å følge endring. Dette er den underbrukte funksjonen. Gjentatte målinger gjennom en behandling viser om noe virker, og det er langt mer informativt enn noen enkeltskår. Målingsbasert behandling bygger på dette.
Beskrivelse av populasjoner. I forskning og folkehelsearbeid estimerer disse instrumentene symptombyrden i ulike grupper, og det er det de er best til.
Slik leser du ditt eget resultat
Hvis du skårer over en terskel på et screeningverktøy, er riktig tolkning: dette gir grunn til en samtale med noen som er kvalifisert. Ikke: jeg har denne tilstanden.
Hvis du skårer under, er riktig tolkning: akkurat denne screeningen flagget ingenting. Ikke: jeg har det bra. Screeningverktøy overser tilfeller, som er den andre halvdelen av avveiningen, og en lav skår hos noen som føler seg uvel, er ingen beroligelse.
Der NOESIS publiserer screeninginstrumenter, oppgir rapportene de publiserte tersklene, navngir kilden og sier tydelig at resultatet ikke er en diagnose. Den innrammingen er ikke en juridisk formalitet; det er det instrumentene selv sier om sin egen bruk.
Sett det på prøve
Å lese om måling er én ting. Å se din egen skår rapportert med kilde, normutvalg og begrensninger er noe annet. Gratis å ta, ingen registrering nødvendig.
Les videre
- Hva er psykometri?Fagfeltet som finner ut om en psykologisk måling er god, og grunnen til at to tester som stiller lignende spørsmål, kan variere enormt i hva resultatene deres er verdt.
- Hva er reliabilitet i psykologisk testing?Reliabilitet er konsistens i målingen, ikke korrekthet. En test kan ha høy reliabilitet og likevel måle feil ting; derfor er det det første spørsmålet som stilles, og aldri det siste.
- Hva er validitet i psykologisk testing?Validitet er ikke en egenskap en test har. Det er et argument for om en bestemt tolkning av en bestemt skår, til et bestemt formål, er forsvarlig, og det må bygges opp på nytt for hver ny bruk.
- Hva er konstruktvaliditet?Det vanskeligste spørsmålet innen måling: om det du måler, finnes slik du har definert det, og om instrumentet ditt når frem til det og ikke til noe som ligger like ved.
- Konvergent og diskriminant validitetTo speilvendte krav: et mål må samsvare med det det bør samsvare med, og må holde seg atskilt fra det det hevder ikke å være. De fleste svake instrumenter feiler på det andre.
- Hva er Cronbachs alfa, og hva er det ikke?Den mest rapporterte statistikken i psykologisk testing, og den mest feiltolkede. Alfa forteller deg ikke at en skala er endimensjonal, og en høy verdi er ofte et symptom snarere enn en dyd.
- Standard målefeil: hvor mye skåren din kan avvikeHver skår har en feilmargin, og for de fleste psykologiske tester er den bredere enn folk tror. Dette er tallet som forteller deg når en forskjell er reell og når den er støy.
- Normer og persentiler: hva skåren din sammenlignes medEn råskår kan ikke tolkes alene. Den får mening først når den sammenlignes med en referansegruppe, og hvilken gruppe som ble brukt, er et av de mest avgjørende og minst omtalte forholdene ved enhver test.
- Hvordan en psykometrisk test faktisk utviklesFra definisjon av konstruktet til publiserte normer tar prosessen flere år og forkaster det meste av det som går inn i den. Når du kjenner trinnene, blir det åpenbart hvilke av dem en rask nettquiz hoppet over.
- Hva betyr det når en test kalles validert?Ordet er ikke regulert og brukes fritt av produkter som ikke har gjort noe av arbeidet. Her er hva det betyr når det faktisk betyr noe, og de fire spørsmålene som skiller de to tilfellene.
- Hvorfor de fleste personlighetstester på internett ikke er reliableIkke fordi de er uærlige, men fordi trinnene som gjør en måling pålitelig, er usynlige, kostbare og lette å hoppe over. Og å hoppe over dem endrer ingenting ved hvordan resultatet ser ut.
- Hva selvrapportering kan og ikke kan måleSpørreskjemaer ber deg være observatør av deg selv, noe som fungerer bedre for noen ting enn for andre. Når du vet hvor metoden er sterk og hvor den svikter, endrer det hvordan du leser ethvert resultat.
- Hva det betyr når en test predikerer noeEn korrelasjon på 0,30 er et sterkt funn i personlighetsforskning og et svakt grunnlag for en beslutning om én person. Begge utsagnene er sanne, og avstanden mellom dem står bak det meste av feilbruken av testresultater.