noesisnoesis
Come si misura

Perché la maggior parte dei test di personalità su internet non sono affidabili

Non perché siano disonesti, ma perché i passaggi che rendono una misurazione attendibile sono invisibili, costosi e facili da saltare — e saltarli non cambia nulla all'aspetto del risultato.

Un test di personalità gratuito online e uno strumento psicometrico validato producono un output che appare identico: un punteggio, un percentile, un paragrafo che ti descrive. La differenza risiede interamente in un lavoro che non puoi vedere dalla schermata dei risultati.

Vale la pena essere precisi su questo punto, perché la solita narrativa — che i test su internet siano truffe — è per lo più errata e non molto utile. La maggior parte viene creata da persone senza alcuna intenzione di ingannare. Sono inaffidabili per ragioni strutturali.

Cosa viene tipicamente saltato

Analisi degli item. In una scala costruita correttamente, la maggior parte degli item redatti viene scartata dopo la fase pilota: item su cui nessuno varia, item che correlano poco con il totale, item che saturano su più di un fattore, item che si comportano diversamente tra gruppi di età o linguistici. Un test scritto e pubblicato senza una fase pilota ha conservato tutto, compresi gli item che non funzionano.

Conferma strutturale indipendente. L'analisi fattoriale sui dati con cui hai costruito la scala recupererà la struttura che hai progettato. Confermarlo su un campione nuovo è uno studio separato, ed è il passaggio in cui una grande quota di scale fallisce.

Norme. Il percentile deve provenire da qualche parte. Se il sito non indica la sua popolazione di riferimento, il numero è derivato o dai visitatori precedenti — un gruppo autoselezionato di composizione sconosciuta — o da nulla in particolare.

Dati test-retest. Stabilire che le persone ottengono lo stesso punteggio il mese successivo richiede di rintracciarle di nuovo. Quasi nessuno lo fa, il che significa che la stabilità implicita nella parola "tratto" non è stata dimostrata.

Gli incentivi di progettazione vanno nella direzione sbagliata

Un test costruito per il coinvolgimento è ottimizzato per un risultato diverso rispetto a un test costruito per l'accuratezza, e i due si allontanano in modi prevedibili.

I risultati lusinghieri performano meglio. Un risultato che ti dice qualcosa di sgradevole viene condiviso meno, quindi i risultati tendono verso descrizioni che tutti riconoscono in sé stessi. Questo è l'effetto Barnum, dimostrato negli anni '40 e riprodotto in modo affidabile da allora: le persone valutano le descrizioni di personalità generiche come altamente accurate su sé stesse in modo specifico.

I tipi performano meglio delle dimensioni. "Sei un Architetto" è più condivisibile di "sei al 68° percentile sull'apertura mentale con un ampio intervallo di confidenza". I tipi nascondono anche l'errore di misurazione, poiché chi si trova un punto da una parte o dall'altra di un confine categoriale riceve etichette completamente diverse.

La brevità performa meglio dell'adeguatezza. Ogni domanda aggiuntiva fa abbandonare i rispondenti, quindi i test vengono ridotti a una lunghezza che massimizza il completamento piuttosto che quella che copre il costrutto.

Nessuna di queste è una bugia. Sono ottimizzazioni per una metrica diversa dall'accuratezza.

Come riconoscerlo in circa trenta secondi

Cerca uno strumento fonte con un nome, autori e un anno. Cerca una dichiarazione su quale popolazione provengano le norme. Cerca qualsiasi riconoscimento di limitazioni o errori di misurazione. Verifica se il risultato è un punteggio continuo o una categoria. Verifica se la stessa pagina promette anche di identificare la tua carriera ideale, il partner o lo scopo di vita da venti domande.

Un test che nomina il suo strumento, cita la sua fonte, indica le sue norme e dice cosa non può dirti ha fatto il suo lavoro. Uno che non fa nulla di tutto ciò può comunque essere un modo piacevole di trascorrere cinque minuti — ma il numero che produce è pura decorazione.

Ogni strumento nel catalogo NOESIS indica quale test pubblicato implementa, chi lo ha scritto, in quale anno, come viene punteggiato e cosa i suoi risultati non stabiliscono. Quest'ultima parte è quella che vale la pena confrontare.

Mettilo alla prova

Leggere di misura è una cosa. Vedere il proprio punteggio con la fonte, il campione normativo e i limiti dichiarati è un'altra. Gratis, senza registrazione.

Continua a leggere

Perché la maggior parte dei test di personalità su internet non sono affidabili | NOESIS