Screening er ikke diagnose
Et screeningspørgeskema er udviklet til at fange så mange mulige tilfælde som muligt og accepterer en høj andel falsk positive som prisen for det. At læse en screeningscore som en diagnose vender op og ned på det, den er designet til.
Et spørgeskema til screening for depression, et screeningsværktøj for angst, et screeningsværktøj for alkoholforbrug: de hører til blandt de bedst validerede instrumenter, der findes, og de bliver rutinemæssigt fejlfortolket. En score over skæringspunktet betyder ikke, at du har tilstanden. Det var aldrig meningen.
Afvejningen i designet
Ethvert screeningsinstrument bygger på en afvejning mellem to fejl: at overse personer, der har tilstanden, og at markere personer, der ikke har den. Screeningsværktøjer er bevidst indstillet mod den anden fejl. At overse et tilfælde af depression i almen praksis er dyrt; et falsk positivt resultat koster en samtale med en kliniker.
Konsekvensen følger af ren aritmetik. Et screeningsværktøj med 88 procent sensitivitet og 85 procent specificitet lyder fremragende. Anvend det i en population, hvor 5 procent faktisk har tilstanden, og af hver 100 personer, der screener positivt, har omkring 74 den ikke. Instrumentet fungerer præcis som specificeret. De fleste positive er alligevel falske.
Dette er basisrate-aritmetik, og det er grunden til, at universel screening i miljøer med lav prævalens er omdiskuteret, selv for velvaliderede instrumenter.
Hvad et skæringspunkt er
Et skæringspunkt er en beslutningstærskel, der er valgt til et bestemt formål i en bestemt population, ikke en naturlig grænse. Det konventionelle skæringspunkt for PHQ-9 på 10 blev udledt i populationer med relativt høj prævalens; anvendt andre steder opfører det sig anderledes. Metaanalyse på individniveau har vist, at publicerede estimater af præcisionen for dette skæringspunkt systematisk var oppustede på grund af selektiv rapportering af optimerede tærskler.
For nogle instrumenter findes der bevidst slet ikke noget universelt skæringspunkt. Verdenssundhedsorganisationens SRQ-20 bruges i snesevis af lande, og dets optimale tærskel varierer så meget efter land, sprog og køn, at det ville gøre mere skade at publicere ét globalt tal end at overlade det til lokal validering.
Diagnose er en anden procedure
En diagnose kræver, at en kliniker fastslår tilstedeværelsen og varigheden af symptomer, deres funktionelle betydning og udelukkelsen af alternative forklaringer: somatiske sygdomme, rusmidler, andre lidelser, der viser sig på lignende måde. Den tager højde for forhistorie og kontekst. Et spørgeskema gør intet af dette. Det tæller selvrapporteret symptomhyppighed inden for en periode.
To personer kan få identiske scorer ud fra helt forskellige kliniske billeder, fordi totalen presser flere uensartede symptomer sammen til ét tal. Scoren er et signal om at se nærmere efter; det at se nærmere efter er diagnosen.
Hvad scoren med rette kan bruges til
En opfordring. En høj score er en grund til at tale med en fagperson. Det er den tilsigtede brug, og den er virkelig værdifuld.
At følge forandring. Dette er den underudnyttede funktion. Gentagne målinger i løbet af en behandling viser, om noget virker, og de er langt mere informative end nogen enkelt score. Målingsbaseret behandling bygger på dette.
Beskrivelse af populationer. I forskning og folkesundhed estimerer disse instrumenter symptombyrden på tværs af grupper, og det er det, de er bedst til.
Sådan læser du dit eget resultat
Hvis du scorer over en tærskel på et screeningsværktøj, er den korrekte fortolkning: dette giver anledning til en samtale med en kvalificeret person. Ikke: jeg har denne tilstand.
Hvis du scorer under, er den korrekte fortolkning: netop denne screening markerede ikke noget. Ikke: jeg har det fint. Screeningsværktøjer overser tilfælde, hvilket er den anden halvdel af afvejningen, og en lav score hos en person, der har det dårligt, er ingen beroligelse.
Når NOESIS publicerer screeningsinstrumenter, angiver rapporterne de publicerede tærskler, nævner kilden og siger klart, at resultatet ikke er en diagnose. Den indramning er ikke en juridisk formalitet; det er det, instrumenterne selv siger om deres egen brug.
Sæt det på prøve
At læse om måling er én ting. At se din egen score rapporteret med kilde, normstikprøve og begrænsninger er noget andet. Gratis at tage, ingen tilmelding nødvendig.
Læs videre
- Hvad er psykometri?Den disciplin, der afgør, om en psykologisk måling er god nok, og grunden til, at to test, der stiller lignende spørgsmål, kan have meget forskellig værdi i deres resultater.
- Hvad er reliabilitet i psykologisk testning?Reliabilitet er målingens konsistens, ikke dens korrekthed. En test kan have høj reliabilitet og alligevel måle den forkerte ting. Derfor er det det første spørgsmål, man stiller, og aldrig det sidste.
- Hvad er validitet i psykologisk testning?Validitet er ikke en egenskab, som en test har. Det er et argument for, om en bestemt fortolkning af en bestemt score til et bestemt formål kan forsvares, og det skal bygges op på ny ved hver ny anvendelse.
- Hvad er konstruktvaliditet?Det sværeste spørgsmål inden for måling: om det, du måler, findes, sådan som du har defineret det, og om dit instrument rammer netop det og ikke noget beslægtet.
- Konvergent og diskriminant validitetTo spejlvendte krav: et mål skal stemme overens med det, det bør stemme overens med, og skal forblive adskilt fra det, det hævder ikke at være. De fleste svage instrumenter fejler på det andet.
- Hvad er Cronbachs alfa, og hvad er det ikke?Den mest rapporterede statistik i psykologisk testning og den mest misforståede. Alpha fortæller dig ikke, at en skala er endimensionel, og en høj værdi er ofte et symptom snarere end en dyd.
- Standardmålefejl: hvor meget din score kan afvigeEnhver score har en fejlmargin, og for de fleste psykologiske test er den bredere, end folk tror. Det er dette tal, der fortæller dig, hvornår en forskel er reel, og hvornår den er støj.
- Normer og percentiler: hvad din score sammenlignes medEn råscore kan ikke fortolkes alene. Den får først mening, når den sammenholdes med en referencegruppe, og hvilken gruppe der er brugt, er et af de mest betydningsfulde og mindst omtalte forhold ved enhver test.
- Sådan bliver en psykometrisk test faktisk udvikletFra definitionen af konstruktet til publicerede normer tager forløbet år og kasserer det meste af det, der indgår i det. Når du kender trinene, bliver det tydeligt, hvilke af dem en hurtig online-quiz har sprunget over.
- Hvad betyder det, når en test kaldes valideret?Ordet er ikke beskyttet og bruges frit af produkter, der ikke har gjort noget af arbejdet. Her er, hvad det betyder, når det betyder noget, og de fire spørgsmål, der adskiller de to tilfælde.
- Hvorfor de fleste personlighedstest på internettet ikke er reliableIkke fordi de er uærlige, men fordi de trin, der gør en måling troværdig, er usynlige, dyre og lette at springe over, og at springe dem over ændrer intet ved, hvordan resultatet ser ud.
- Hvad selvrapportering kan og ikke kan måleSpørgeskemaer beder dig om at være observatør af dig selv, og det fungerer bedre for nogle ting end for andre. Når du ved, hvor metoden er stærk, og hvor den svigter, ændrer det måden, du læser ethvert resultat på.
- Hvad det betyder, når en test forudsiger nogetEn korrelation på 0,30 er et stærkt fund i personlighedsforskning og et svagt grundlag for en beslutning om en enkelt person. Begge udsagn er sande, og kløften mellem dem er årsagen til det meste misbrug af testresultater.