Vad är begreppsvaliditet?
Den svåraste frågan inom mätning: om det du mäter existerar som du har definierat det, och om ditt instrument når fram till det snarare än till något närliggande.
Begreppsvaliditet handlar om huruvida ett instrument mäter det teoretiska begrepp det påstår sig mäta, snarare än något som korrelerar med det, något som är smalare än det, eller ingenting sammanhängande alls. Det är den djupaste formen av validitetsbevis, och den som tar år snarare än en studie att fastställa.
Svårigheten är strukturell. Ett begrepp som resiliens eller emotionell intelligens är inte ett objekt; det är ett föreslaget mönster i beteende. För att visa att en skala mäter det måste man samtidigt försvara påståendet att begreppet existerar som beskrivet och att just dessa items når fram till det. De två påståendena kan inte separeras, vilket är varför Cronbach och Meehl, som introducerade idén 1955, formulerade det som att testa ett helt teoretiskt nätverk snarare än ett enskilt instrument.
Hur fallet byggs upp
Förutsagda korrelationsmönster. Teorin anger vilka saker begreppet ska relatera till och hur starkt. Självmedkänsla bör korrelera positivt med livstillfredsställelse, negativt med depression, och bara måttligt med självkänsla, om den korrelerade 0,9 med självkänsla skulle den inte vara ett distinkt begrepp. Varje sådant antagande är ett testbart påstående, och att ett av dem inte stämmer ger information.
Förväntade gruppskillnader. Om teorin säger att ett drag utvecklas med åldern, eller är förhöjt i en klinisk population, bör instrumentet visa det. Att inte finna en skillnad som teorin kräver är belägg mot instrumentet, teorin, eller båda.
Respons på intervention. Om ett begrepp antas vara tränbart bör poängen ändras efter träning och inte ändras i en kontrollgrupp. Begrepp som aldrig svarar på något är svåra att skilja från artefakter.
Intern struktur. Faktorstrukturen bör matcha den teoretiserade strukturen, och viktigt, i ett nytt urval. Explorativ faktoranalys på utvecklingsdata kommer att hitta vilken struktur som helst som byggts in; konfirmatorisk analys på nya data är där påståendet faktiskt testas.
Idén om multitrait-multimethod
Campbell och Fiskes bidrag från 1959 var att insistera på att begreppsvaliditet kräver två saker samtidigt: mått på samma drag med olika metoder bör stämma överens, och mått på olika drag med samma metod bör inte göra det.
Den andra halvan är där de flesta instrument har svårt. Om din självskattade empati korrelerar 0,7 med din självskattade vänlighet och 0,2 med observatörsskattad empati, är det starkaste ditt frågeformulär mäter inte empati, det är ditt allmänna sätt att beskriva dig själv i frågeformulär. Metodvarians är ett av de mest ihållande problemen inom självskattningsforskning, och det är varför seriöst valideringsarbete söker ett kriterium bortom frågeformulär där ett sådant finns.
Varför detta spelar roll när du läser dina resultat
Begreppsvaliditet är det som står mellan en poäng och dess tolkning. När ett väl validerat instrument rapporterar att du får hög poäng på ett drag, innehåller kedjan av resonemang bakom det påståendet decennier av publicerat arbete som fastställer att draget beter sig som en sammanhängande storhet, att dessa items följer det, och att poängen betyder något liknande hos de personer som gör testet.
När ett test utan begreppsvalidering rapporterar samma sak är poängen en siffra genererad av en algoritm som ingen har kontrollerat. Båda ser identiska ut på resultatskärmen. Skillnaden ligger helt och hållet i dokumentationen, vilket är varför dokumentationen är värd att leta efter.
Sätt det på prov
Att läsa om mätning är en sak. Att se ditt eget poäng rapporterat med källa, normgrupp och begränsningar är en annan. Gratis att göra, ingen registrering krävs.
Fortsätt läsa
- Vad är psykometri?Disciplinen som avgör om en psykologisk mätning är bra, och anledningen till att två test som ställer liknande frågor kan skilja sig enormt åt i vad deras resultat är värda.
- Vad är reliabilitet vid psykologisk testning?Reliabilitet är mätningens konsekvens, inte dess korrekthet. Ett test kan vara mycket reliabelt och ändå mäta fel sak, vilket är varför det är den första frågan som ställs och aldrig den sista.
- Vad är validitet inom psykologisk testning?Validitet är inte en egenskap som ett test har. Det är ett argument för om en viss tolkning av ett visst poäng, för ett visst syfte, är försvarbar, och det måste byggas upp på nytt för varje ny användning.
- Konvergent och diskriminant validitetTvå spegelbildskrav: ett mått måste överensstämma med det det ska överensstämma med, och samtidigt förbli distinkt från det det påstår sig inte vara. De flesta svaga instrument misslyckas med det andra kravet.
- Vad är Cronbachs alfa, och vad det inte ärDen mest rapporterade statistiken inom psykologisk testning, och den mest missförstådda. Alfa säger inte att en skala är endimensionell, och ett högt värde är ofta ett symptom snarare än en dygd.
- Mätningens standardfel: hur mycket din poäng kan avvikaVarje poäng har en felmarginal, och för de flesta psykologiska test är den bredare än vad folk antar. Det här är talet som talar om när en skillnad är verklig och när den är brus.
- Normer och percentiler: vad din poäng jämförs medEn rå poäng är omöjlig att tolka på egen hand. Den blir meningsfull först i jämförelse med en referensgrupp, och vilken grupp som använts är ett av de mest avgörande och minst annonserade fakta om något test.
- Hur ett psykometriskt test faktiskt byggsFrån konstruktdefinition till publicerade normer tar sekvensen år och gallrar bort det mesta av det som går in i den. Att känna till stegen gör det uppenbart vilka som ett snabbt onlinetest hoppade över.
- Vad innebär det när ett test kallas validerat?Ordet är oreglerat och används fritt av produkter som inte gjort något av arbetet. Här är vad det betyder när det betyder något, och de fyra frågorna som skiljer de två fallen åt.
- Varför de flesta personlighetstest på internet inte är reliablaInte för att de är oärliga, utan för att de steg som gör en mätning pålitlig är osynliga, kostsamma och lätta att hoppa över, och att hoppa över dem förändrar ingenting i hur resultatet ser ut.
- Vad självskattning kan och inte kan mätaFrågeformulär ber dig vara observatör av dig själv, vilket fungerar bättre för vissa saker än andra. Att veta var metoden är stark och var den brister förändrar hur du läser vilket resultat som helst.
- Vad det innebär när ett test förutsäger någotEn korrelation på 0,30 är ett starkt fynd inom personlighetsforskning och en svag grund för ett beslut om en enskild person. Båda påståendena är sanna, och glappet mellan dem orsakar det mesta av missbruket av testresultat.
- Screening är inte diagnosEtt screeningformulär är byggt för att fånga upp så många möjliga fall som möjligt, och accepterar en hög andel falska positiva som priset för det. Att läsa ett screeningresultat som en diagnos vänder upp och ner på vad det var utformat för att göra.