noesisnoesis
Come si misura

Cos'è la validità nei test psicologici?

La validità non è una proprietà che un test possiede. È un argomento riguardo al fatto che una particolare interpretazione di un particolare punteggio, per uno scopo particolare, sia difendibile — e deve essere ricostruita per ogni nuovo utilizzo.

La validità si chiede se un test misura ciò che afferma di misurare e se le conclusioni che le persone traggono dai suoi punteggi siano giustificate. È la domanda centrale nella psicometria e quella a cui più spesso si risponde con un'affermazione di marketing piuttosto che con prove.

La comprensione moderna, consolidatasi a partire dal lavoro di Messick negli anni '80, è che la validità non è un attributo fisso di uno strumento. È una proprietà di un'interpretazione dei punteggi per un uso specifico. Lo stesso questionario può essere ben validato per descrivere l'autopercepzione di una persona e del tutto privo di validazione per decidere se assumerla. Dire «questo test è valido» senza specificare valido per cosa non è un'affermazione; è uno slogan.

I tipi di prove

La validità è costruita da prove accumulate di diversi tipi. I testi più datati le presentano come specie separate di validità; la visione attuale le considera come argomenti diversi a sostegno di un unico caso.

Le prove di contenuto si chiedono se gli item coprono adeguatamente il costrutto. Una scala per la depressione che chiede solo del sonno e dell'appetito copre i sintomi somatici e manca quelli dell'umore e cognitivi. La copertura dei contenuti viene solitamente valutata da esperti della materia, ed è il motivo per cui le scale molto brevi sono sempre un compromesso.

Le prove della struttura interna si chiedono se gli item si raggruppano nel modo in cui la teoria prevede. Se un modello afferma quattro facce distinte, l'analisi fattoriale dovrebbe recuperare quattro fattori — e, cosa fondamentale, in un campione indipendente, non solo in quello su cui la scala è stata costruita. Moltissimi strumenti recuperano la loro struttura intesa nel campione di sviluppo e falliscono in tutti gli altri.

Le relazioni con altre variabili è dove avviene la maggior parte del lavoro. Le prove convergenti mostrano che la scala è correlata con ciò con cui dovrebbe esserlo. Le prove discriminanti mostrano che non è correlata eccessivamente con ciò da cui dovrebbe essere distinta — un requisito cronicamente trascurato, e quello che affonda molti costrutti di nuova denominazione. Le prove di criterio mostrano che il punteggio è correlato a un esito rilevante, misurato contestualmente o previsto in anticipo.

Le prove consequenziali si chiedono cosa accade quando il test viene utilizzato. Se uno strumento svantaggia sistematicamente un gruppo per ragioni non legate al costrutto, si tratta di un problema di validità, non semplicemente etico.

La domanda che smonta la maggior parte delle affermazioni

Il test più stringente di un'affermazione di validità è la validità incrementale: questo strumento aggiunge qualcosa rispetto a ciò che una misura più economica, più vecchia e consolidata già fornisce?

Un numero sorprendente di costrutti con marchio commerciale fallisce qui. Correlano 0,7 o più con un dominio esistente dei Big Five, prevedono gli stessi esiti con la stessa entità e non aggiungono nulla una volta che la misura più datata è statisticamente controllata. Il costrutto è nuovo; la misurazione non lo è. È per questo che le sezioni critiche della documentazione seria sugli strumenti vertono così spesso sulla ridondanza piuttosto che sull'inaccuratezza.

Cosa cercare

Quando qualcuno afferma che un test è validato, le domande utili sono concrete. Validato rispetto a quale criterio? In quale popolazione, di quale dimensione? La struttura fattoriale è stata confermata in un campione indipendente? Esistono prove pubblicate da ricercatori privi di interessi commerciali nella risposta? Aggiunge qualcosa rispetto a un'alternativa consolidata?

Uno strumento con risposte oneste a queste domande vale la pena di essere preso sul serio, limiti compresi. Uno strumento la cui validazione consiste in una pagina di testimonianze e nell'affermazione che milioni di persone lo hanno compilato ha risposto a una domanda completamente diversa — la popolarità non è una prova, e il numero di persone che hanno sostenuto un test non dice nulla sul fatto che i suoi punteggi abbiano un significato.

Mettilo alla prova

Leggere di misura è una cosa. Vedere il proprio punteggio con la fonte, il campione normativo e i limiti dichiarati è un'altra. Gratis, senza registrazione.

Continua a leggere