noesisnoesis
Come si misura

Errore standard di misurazione: di quanto potrebbe sbagliarsi il tuo punteggio

Ogni punteggio porta con sé un margine di errore, e per la maggior parte dei test psicologici è più ampio di quanto le persone suppongano. Questo è il numero che ti dice quando una differenza è reale e quando è solo rumore.

L'errore standard di misurazione converte un coefficiente di affidabilità astratto in qualcosa di concreto: una fascia di più o meno attorno a un punteggio. Risponde alla domanda che la maggior parte dei risultati lascia senza risposta — di quanto avrebbe potuto differire questo numero se avessi sostenuto il test in un pomeriggio diverso?

La formula è semplice. Moltiplica la deviazione standard della scala per la radice quadrata di uno meno la sua affidabilità. Per una scala con deviazione standard di 10 e affidabilità di 0,85, l'errore standard è di circa 3,9 punti.

Cosa copre davvero quella fascia

Approssimativamente due terzi delle volte, il punteggio reale di una persona si trova entro un errore standard dal punteggio osservato. Per avere circa il 95 percento di confidenza, sono necessari circa due errori standard per lato.

Prendiamo l'esempio sopra. Qualcuno ottiene 62. L'intervallo al 95 percento va da circa 54 a 70. Si tratta di una finestra di sedici punti su una scala in cui il divario tipico tra nella media e chiaramente sopra la media potrebbe essere di dieci punti.

Questo non è un difetto di quel test particolare. Un'affidabilità di 0,85 è rispettabile. È la precisione normale della misurazione psicologica, ed è il motivo per cui i rapporti accurati presentano fasce anziché punti singoli.

Le conseguenze che le persone non considerano

Le piccole differenze tra scale sono generalmente prive di significato. Se la tua estroversione è 58 e la tua apertura mentale è 54, la lettura onesta è che sono indistinguibili. Le interpretazioni dei profili che costruiscono una narrazione da differenze di quattro punti stanno leggendo il rumore.

Anche i piccoli cambiamenti nel tempo sono generalmente privi di significato. Ripetere un test e spostarsi di cinque punti rientra nell'errore per la maggior parte degli strumenti. Il vero cambiamento nei tratti avviene nel corso degli anni e si manifesta come un movimento ben al di fuori della fascia di errore, non come qualche punto da un mese all'altro.

Le classifiche amplificano il problema. Una differenza di pochi punti grezzi può spostare qualcuno di dieci posizioni percentili nella parte centrale densa di una distribuzione, perché è lì che si trova la maggior parte delle persone. I ranghi percentili sembrano precisi e sono il modo meno stabile per esprimere un punteggio.

La precisione non è uniforme lungo la scala. La teoria classica dei test assume un unico valore di errore per ogni punteggio, il che è una semplificazione. La teoria della risposta all'item modella l'errore separatamente per ogni livello del tratto, ed è quasi sempre più grande agli estremi — proprio dove vengono fatte le interpretazioni più significative. Un punteggio molto alto o molto basso è tipicamente meno preciso di uno intermedio, non più preciso.

Perché una comunicazione onesta appare meno impressionante

Uno strumento che riporta le fasce di confidenza appare più vago di uno che riporta un singolo numero con un decimale. Quello più vago sta dicendo la verità. Quello dall'apparenza precisa ha lo stesso errore sottostante e ha scelto di non mostrarlo.

È utile tenerlo a mente quando si confronta un test scientificamente documentato con un prodotto commerciale che ti assegna a una categoria. Il confine della categoria si trova a un punteggio specifico, e chi si trova un punto al di sotto e chi si trova un punto al di sopra sono, statisticamente, la stessa persona. L'etichetta tipologica lo nasconde completamente — il che è uno degli argomenti più seri contro gli strumenti basati sui tipi, e il motivo per cui i punteggi continui con errore dichiarato sono lo standard nella ricerca.

Mettilo alla prova

Leggere di misura è una cosa. Vedere il proprio punteggio con la fonte, il campione normativo e i limiti dichiarati è un'altra. Gratis, senza registrazione.

Continua a leggere