Vad innebär det när ett test kallas validerat?
Ordet är oreglerat och används fritt av produkter som inte gjort något av arbetet. Här är vad det betyder när det betyder något, och de fyra frågorna som skiljer de två fallen åt.
"Vetenskapligt validerad" är inte en skyddad term. Ingen certifierar det, inget organ granskar det, och det förekommer på produkter vars hela evidensbas är att många människor har genomfört dem. Det är värt att veta vad det betyder när det används på rätt sätt.
Den korta versionen
Ett validerat instrument har ett publicerat underlag som visar vad det mäter, hur precist, i vilka populationer, och vad dess poäng legitimt kan användas till. Validering är inte ett certifikat. Det är en samling belägg, vanligtvis sammanställd under flera år, som oftast inkluderar fynd som begränsar instrumentets användning snarare än smickrar det.
Förekomsten av dokumenterade begränsningar är en av de bättre signalerna. Genuin valideringslitteratur är full av dem: den här skalan fungerar dåligt hos ungdomar, den där facetten replikeras inte, gränsvärdet är populationsberoende. En produkt som bara rapporterar styrkor har inte publicerat sin validering; den har publicerat sin marknadsföring.
Fyra frågor som gör jobbet
Vad är källpublikationen? Ett validerat instrument har en originalartikel i en peer-granskad tidskrift, med författare, ett år och oftast en DOI. Den artikeln redogör för hur items utvecklades och vilka de ursprungliga psykometriska egenskaperna var. Om ingen kan namnge artikeln finns det ingen validering att diskutera.
Bekräftades strukturen av någon annan? Utvecklingsteamet kommer att återskapa den struktur de själva designade. Det som spelar roll är om en oberoende grupp, med oberoende data, fann samma sak. Detta är den enskilt mest informativa frågan du kan ställa, och den som oftast lämnas obesvarad.
Vilken population byggdes normerna på, och när? En poäng är en position i en referensfördelning. Ett instrument som anger en percentil utan att ange vilken population den avser har gett dig ett tal utan nämnare.
Vad tillför det? Inkrementell validitet utöver ett etablerat mått. Väldigt många varumärkesbaserade konstrukt misslyckas här, de korrelerar så högt med ett befintligt drag att de inte förklarar någon ytterligare varians i något. Detta är ett normalt resultat av vetenskaplig granskning, och det är osynligt om ingen kör testet.
Var översättning komplicerar saken
Ett instrument som validerats på engelska är därmed inte validerat på tyska. En korrekt tvärkulturell anpassning kräver fram- och återöversättning, expertgranskning, kognitiva intervjuer, och därefter en ny psykometrisk studie på det nya språket som testar om faktorstrukturen håller och om enskilda items fungerar likvärdigt mellan grupper.
Instrument som hoppar över detta är vanliga. Ett frågeformulär vars ursprungliga validering är oklanderlig kan bete sig helt annorlunda på ett språk där ett nyckelitem bär en annan konnotation, och det finns inget sätt att veta utan studien. När ett test erbjuds på tio språk är den relevanta frågan om det validerades på tio språk eller validerades på ett och översattes till nio.
Vad validering inte ger dig
Det gör inte en poäng säker. Ett validerat instrument har fortfarande mätfel, beskriver fortfarande en regelbundenhet på populationsnivå snarare än ett individuellt öde, och mäter fortfarande bara det som dess items når.
Det validering ger är kända gränser. Du kan ta reda på hur mycket fel, i vilken population, för vilket syfte. Det är ett mindre anspråk än "det här testet avslöjar vem du verkligen är", och det är det enda som håller.
Om du vill se hur dokumentationen ser ut när den finns: varje test i NOESIS katalog anger vilket instrument det implementerar, dess författare och år, dess poängsättningsmetod, och beläggen bakom det, inklusive var dessa belägg är omtvistade.
Sätt det på prov
Att läsa om mätning är en sak. Att se ditt eget poäng rapporterat med källa, normgrupp och begränsningar är en annan. Gratis att göra, ingen registrering krävs.
Fortsätt läsa
- Vad är psykometri?Disciplinen som avgör om en psykologisk mätning är bra, och anledningen till att två test som ställer liknande frågor kan skilja sig enormt åt i vad deras resultat är värda.
- Vad är reliabilitet vid psykologisk testning?Reliabilitet är mätningens konsekvens, inte dess korrekthet. Ett test kan vara mycket reliabelt och ändå mäta fel sak, vilket är varför det är den första frågan som ställs och aldrig den sista.
- Vad är validitet inom psykologisk testning?Validitet är inte en egenskap som ett test har. Det är ett argument för om en viss tolkning av ett visst poäng, för ett visst syfte, är försvarbar, och det måste byggas upp på nytt för varje ny användning.
- Vad är begreppsvaliditet?Den svåraste frågan inom mätning: om det du mäter existerar som du har definierat det, och om ditt instrument når fram till det snarare än till något närliggande.
- Konvergent och diskriminant validitetTvå spegelbildskrav: ett mått måste överensstämma med det det ska överensstämma med, och samtidigt förbli distinkt från det det påstår sig inte vara. De flesta svaga instrument misslyckas med det andra kravet.
- Vad är Cronbachs alfa, och vad det inte ärDen mest rapporterade statistiken inom psykologisk testning, och den mest missförstådda. Alfa säger inte att en skala är endimensionell, och ett högt värde är ofta ett symptom snarare än en dygd.
- Mätningens standardfel: hur mycket din poäng kan avvikaVarje poäng har en felmarginal, och för de flesta psykologiska test är den bredare än vad folk antar. Det här är talet som talar om när en skillnad är verklig och när den är brus.
- Normer och percentiler: vad din poäng jämförs medEn rå poäng är omöjlig att tolka på egen hand. Den blir meningsfull först i jämförelse med en referensgrupp, och vilken grupp som använts är ett av de mest avgörande och minst annonserade fakta om något test.
- Hur ett psykometriskt test faktiskt byggsFrån konstruktdefinition till publicerade normer tar sekvensen år och gallrar bort det mesta av det som går in i den. Att känna till stegen gör det uppenbart vilka som ett snabbt onlinetest hoppade över.
- Varför de flesta personlighetstest på internet inte är reliablaInte för att de är oärliga, utan för att de steg som gör en mätning pålitlig är osynliga, kostsamma och lätta att hoppa över, och att hoppa över dem förändrar ingenting i hur resultatet ser ut.
- Vad självskattning kan och inte kan mätaFrågeformulär ber dig vara observatör av dig själv, vilket fungerar bättre för vissa saker än andra. Att veta var metoden är stark och var den brister förändrar hur du läser vilket resultat som helst.
- Vad det innebär när ett test förutsäger någotEn korrelation på 0,30 är ett starkt fynd inom personlighetsforskning och en svag grund för ett beslut om en enskild person. Båda påståendena är sanna, och glappet mellan dem orsakar det mesta av missbruket av testresultat.
- Screening är inte diagnosEtt screeningformulär är byggt för att fånga upp så många möjliga fall som möjligt, och accepterar en hög andel falska positiva som priset för det. Att läsa ett screeningresultat som en diagnos vänder upp och ner på vad det var utformat för att göra.