Cos'è l'attendibilità nei test psicologici?
L'attendibilità è la coerenza della misurazione, non la sua correttezza. Un test può essere altamente attendibile e misurare comunque la cosa sbagliata — ecco perché è la prima domanda da porsi, ma mai l'ultima.
L'attendibilità è il grado in cui una misurazione è ripetibile anziché casuale. Se vi pesaste tre volte in un minuto e otteneste 71, 78 e 66 chilogrammi, la bilancia sarebbe inattendibile — e non avreste modo di conoscere il vostro peso reale da essa. La misurazione psicologica affronta lo stesso problema con strumenti molto meno precisi.
L'aspetto fondamentale da comprendere sull'attendibilità è ciò che essa non afferma. Una bilancia da bagno che indica sistematicamente otto chilogrammi in più è perfettamente attendibile e completamente sbagliata. L'attendibilità riguarda la coerenza; se il numero misuri la cosa giusta è una questione separata, chiamata validità. L'attendibilità è necessaria per la validità, ma non è affatto sufficiente.
Le forme che assume
La coerenza interna chiede se gli item di una scala concordino tra loro. Se dieci domande sono tutte destinate a rilevare lo stesso tratto sottostante, chi risponde in modo elevato a una dovrebbe tendere a rispondere in modo elevato anche alle altre. Viene solitamente riportata come alpha di Cronbach o, meglio, come omega di McDonald.
L'attendibilità test-retest chiede se la stessa persona ottenga punteggi simili in due occasioni diverse. È la forma più importante per i tratti, che per definizione dovrebbero essere stabili. È anche la forma meno spesso riportata, perché richiede di rintracciare gli stessi partecipanti settimane dopo.
L'attendibilità inter-rater si applica quando sono esseri umani a valutare lo strumento — interviste cliniche, tecniche proiettive, osservazione comportamentale. Chiede se due valutatori esperti che esaminano lo stesso materiale giungano alla stessa conclusione.
L'attendibilità delle forme parallele chiede se due versioni diverse dello stesso test, costruite per essere equivalenti, producano gli stessi punteggi. È rilevante ogni volta che un test viene somministrato più di una volta e l'esposizione agli item rappresenta un problema.
Leggere i numeri
I coefficienti di attendibilità vanno da 0 a 1. Le convenzioni sono approssimative e spesso mal applicate, ma in linea di massima: superiore a 0,90 è richiesto quando un punteggio incide sulla vita di un individuo; tra 0,80 e 0,90 è solido per la maggior parte degli usi applicati; tra 0,70 e 0,80 è accettabile per la ricerca e per i confronti tra gruppi; al di sotto di 0,70 il punteggio contiene più rumore di quanto la maggior parte delle conclusioni possa tollerare.
Due avvertenze su queste soglie. Prima di tutto, sono convenzioni, non leggi — il livello accettabile dipende interamente dall'uso a cui il punteggio sarà destinato. In secondo luogo, un alpha molto elevato su una scala breve indica di solito che gli item sono quasi parafrasi l'uno dell'altro, il che acquista coerenza a scapito della copertura del costrutto. Una scala di dieci domande che chiedono tutte «sei una persona organizzata?» con parole leggermente diverse avrà un'ottima coerenza interna e una lettura ristretta della coscienziosità.
Cosa significa per il proprio punteggio
L'attendibilità si traduce direttamente nel grado di fiducia che un singolo numero merita. Un test con un'attendibilità di 0,85 presenta un errore di misurazione abbastanza ampio da rendere molto probabile che una differenza di pochi punti tra due persone, o tra il vostro punteggio di oggi e quello del mese scorso, sia rumore piuttosto che segnale.
Questa è la conseguenza pratica: uno strumento valido riporta la propria attendibilità, così sapete quanto è ampia l'incertezza attorno al vostro punteggio. L'espressione tecnica di tale incertezza è l'errore standard della misurazione, che converte un coefficiente di attendibilità in una banda di più o meno attorno al punteggio.
Uno strumento che non riporta alcun indice di attendibilità non è per questo più preciso. Ha semplicemente rinunciato a dirvi quanto sia impreciso.
Mettilo alla prova
Leggere di misura è una cosa. Vedere il proprio punteggio con la fonte, il campione normativo e i limiti dichiarati è un'altra. Gratis, senza registrazione.
Continua a leggere
- Cos'è la psicometria?La disciplina che stabilisce se una misurazione psicologica è valida — e il motivo per cui due test che pongono domande simili possono differire enormemente nel valore dei loro risultati.
- Cos'è la validità nei test psicologici?La validità non è una proprietà che un test possiede. È un argomento riguardo al fatto che una particolare interpretazione di un particolare punteggio, per uno scopo particolare, sia difendibile — e deve essere ricostruita per ogni nuovo utilizzo.
- Cos'è la validità di costrutto?La domanda più difficile nella misurazione: se ciò che si sta misurando esiste così come lo si è definito, e se lo strumento lo raggiunge anziché qualcosa di adiacente.
- Validità convergente e discriminanteDue requisiti speculari: una misura deve concordare con ciò con cui dovrebbe concordare, e deve restare distinta da ciò da cui afferma di differire. La maggior parte degli strumenti deboli fallisce il secondo.
- Cos'è l'alpha di Cronbach — e cosa non èLa statistica più riportata nei test psicologici, e la più fraintesa. L'alpha non indica che una scala è unidimensionale, e un valore elevato è spesso un sintomo anziché un pregio.
- Errore standard di misurazione: di quanto potrebbe sbagliarsi il tuo punteggioOgni punteggio porta con sé un margine di errore, e per la maggior parte dei test psicologici è più ampio di quanto le persone suppongano. Questo è il numero che ti dice quando una differenza è reale e quando è solo rumore.
- Norme e percentili: con cosa viene confrontato il tuo punteggioUn punteggio grezzo è di per sé ininterpretabile. Diventa significativo solo in relazione a un gruppo di riferimento — e quale gruppo sia stato utilizzato è uno dei fatti più rilevanti e meno pubblicizzati di qualsiasi test.
- Come viene costruito davvero un test psicometricoDalla definizione del costrutto alle norme pubblicate, il processo richiede anni e scarta la maggior parte di ciò che vi viene immesso. Conoscere le fasi rende evidente quali siano quelle che un rapido quiz online ha saltato.
- Cosa significa quando un test viene definito validato?Il termine non è regolamentato e viene usato liberamente da prodotti che non hanno fatto nessuno dei lavori necessari. Ecco cosa significa quando ha un senso concreto, e le quattro domande che separano i due casi.
- Perché la maggior parte dei test di personalità su internet non sono affidabiliNon perché siano disonesti, ma perché i passaggi che rendono una misurazione attendibile sono invisibili, costosi e facili da saltare — e saltarli non cambia nulla all'aspetto del risultato.
- Cosa può e non può misurare l'autovalutazioneI questionari ti chiedono di osservare te stesso, il che funziona meglio per alcune cose che per altre. Sapere dove il metodo è solido e dove invece fallisce cambia il modo in cui interpreti qualsiasi risultato.
- Cosa significa quando un test prevede qualcosaUna correlazione di 0,30 è un risultato solido nella ricerca sulla personalità e una base debole per una decisione su una singola persona. Entrambe le affermazioni sono vere, e il divario tra di esse è la causa principale dell'uso improprio dei risultati dei test.
- Lo screening non è una diagnosiUn questionario di screening è concepito per intercettare il maggior numero possibile di casi, accettando un alto tasso di falsi positivi come prezzo da pagare. Interpretare un punteggio di screening come una diagnosi inverte lo scopo per cui è stato progettato.