Perché la maggior parte dei test di personalità su internet non sono affidabili
Non perché siano disonesti, ma perché i passaggi che rendono una misurazione attendibile sono invisibili, costosi e facili da saltare — e saltarli non cambia nulla all'aspetto del risultato.
Un test di personalità gratuito online e uno strumento psicometrico validato producono un output che appare identico: un punteggio, un percentile, un paragrafo che ti descrive. La differenza risiede interamente in un lavoro che non puoi vedere dalla schermata dei risultati.
Vale la pena essere precisi su questo punto, perché la solita narrativa — che i test su internet siano truffe — è per lo più errata e non molto utile. La maggior parte viene creata da persone senza alcuna intenzione di ingannare. Sono inaffidabili per ragioni strutturali.
Cosa viene tipicamente saltato
Analisi degli item. In una scala costruita correttamente, la maggior parte degli item redatti viene scartata dopo la fase pilota: item su cui nessuno varia, item che correlano poco con il totale, item che saturano su più di un fattore, item che si comportano diversamente tra gruppi di età o linguistici. Un test scritto e pubblicato senza una fase pilota ha conservato tutto, compresi gli item che non funzionano.
Conferma strutturale indipendente. L'analisi fattoriale sui dati con cui hai costruito la scala recupererà la struttura che hai progettato. Confermarlo su un campione nuovo è uno studio separato, ed è il passaggio in cui una grande quota di scale fallisce.
Norme. Il percentile deve provenire da qualche parte. Se il sito non indica la sua popolazione di riferimento, il numero è derivato o dai visitatori precedenti — un gruppo autoselezionato di composizione sconosciuta — o da nulla in particolare.
Dati test-retest. Stabilire che le persone ottengono lo stesso punteggio il mese successivo richiede di rintracciarle di nuovo. Quasi nessuno lo fa, il che significa che la stabilità implicita nella parola "tratto" non è stata dimostrata.
Gli incentivi di progettazione vanno nella direzione sbagliata
Un test costruito per il coinvolgimento è ottimizzato per un risultato diverso rispetto a un test costruito per l'accuratezza, e i due si allontanano in modi prevedibili.
I risultati lusinghieri performano meglio. Un risultato che ti dice qualcosa di sgradevole viene condiviso meno, quindi i risultati tendono verso descrizioni che tutti riconoscono in sé stessi. Questo è l'effetto Barnum, dimostrato negli anni '40 e riprodotto in modo affidabile da allora: le persone valutano le descrizioni di personalità generiche come altamente accurate su sé stesse in modo specifico.
I tipi performano meglio delle dimensioni. "Sei un Architetto" è più condivisibile di "sei al 68° percentile sull'apertura mentale con un ampio intervallo di confidenza". I tipi nascondono anche l'errore di misurazione, poiché chi si trova un punto da una parte o dall'altra di un confine categoriale riceve etichette completamente diverse.
La brevità performa meglio dell'adeguatezza. Ogni domanda aggiuntiva fa abbandonare i rispondenti, quindi i test vengono ridotti a una lunghezza che massimizza il completamento piuttosto che quella che copre il costrutto.
Nessuna di queste è una bugia. Sono ottimizzazioni per una metrica diversa dall'accuratezza.
Come riconoscerlo in circa trenta secondi
Cerca uno strumento fonte con un nome, autori e un anno. Cerca una dichiarazione su quale popolazione provengano le norme. Cerca qualsiasi riconoscimento di limitazioni o errori di misurazione. Verifica se il risultato è un punteggio continuo o una categoria. Verifica se la stessa pagina promette anche di identificare la tua carriera ideale, il partner o lo scopo di vita da venti domande.
Un test che nomina il suo strumento, cita la sua fonte, indica le sue norme e dice cosa non può dirti ha fatto il suo lavoro. Uno che non fa nulla di tutto ciò può comunque essere un modo piacevole di trascorrere cinque minuti — ma il numero che produce è pura decorazione.
Ogni strumento nel catalogo NOESIS indica quale test pubblicato implementa, chi lo ha scritto, in quale anno, come viene punteggiato e cosa i suoi risultati non stabiliscono. Quest'ultima parte è quella che vale la pena confrontare.
Mettilo alla prova
Leggere di misura è una cosa. Vedere il proprio punteggio con la fonte, il campione normativo e i limiti dichiarati è un'altra. Gratis, senza registrazione.
Continua a leggere
- Cos'è la psicometria?La disciplina che stabilisce se una misurazione psicologica è valida — e il motivo per cui due test che pongono domande simili possono differire enormemente nel valore dei loro risultati.
- Cos'è l'attendibilità nei test psicologici?L'attendibilità è la coerenza della misurazione, non la sua correttezza. Un test può essere altamente attendibile e misurare comunque la cosa sbagliata — ecco perché è la prima domanda da porsi, ma mai l'ultima.
- Cos'è la validità nei test psicologici?La validità non è una proprietà che un test possiede. È un argomento riguardo al fatto che una particolare interpretazione di un particolare punteggio, per uno scopo particolare, sia difendibile — e deve essere ricostruita per ogni nuovo utilizzo.
- Cos'è la validità di costrutto?La domanda più difficile nella misurazione: se ciò che si sta misurando esiste così come lo si è definito, e se lo strumento lo raggiunge anziché qualcosa di adiacente.
- Validità convergente e discriminanteDue requisiti speculari: una misura deve concordare con ciò con cui dovrebbe concordare, e deve restare distinta da ciò da cui afferma di differire. La maggior parte degli strumenti deboli fallisce il secondo.
- Cos'è l'alpha di Cronbach — e cosa non èLa statistica più riportata nei test psicologici, e la più fraintesa. L'alpha non indica che una scala è unidimensionale, e un valore elevato è spesso un sintomo anziché un pregio.
- Errore standard di misurazione: di quanto potrebbe sbagliarsi il tuo punteggioOgni punteggio porta con sé un margine di errore, e per la maggior parte dei test psicologici è più ampio di quanto le persone suppongano. Questo è il numero che ti dice quando una differenza è reale e quando è solo rumore.
- Norme e percentili: con cosa viene confrontato il tuo punteggioUn punteggio grezzo è di per sé ininterpretabile. Diventa significativo solo in relazione a un gruppo di riferimento — e quale gruppo sia stato utilizzato è uno dei fatti più rilevanti e meno pubblicizzati di qualsiasi test.
- Come viene costruito davvero un test psicometricoDalla definizione del costrutto alle norme pubblicate, il processo richiede anni e scarta la maggior parte di ciò che vi viene immesso. Conoscere le fasi rende evidente quali siano quelle che un rapido quiz online ha saltato.
- Cosa significa quando un test viene definito validato?Il termine non è regolamentato e viene usato liberamente da prodotti che non hanno fatto nessuno dei lavori necessari. Ecco cosa significa quando ha un senso concreto, e le quattro domande che separano i due casi.
- Cosa può e non può misurare l'autovalutazioneI questionari ti chiedono di osservare te stesso, il che funziona meglio per alcune cose che per altre. Sapere dove il metodo è solido e dove invece fallisce cambia il modo in cui interpreti qualsiasi risultato.
- Cosa significa quando un test prevede qualcosaUna correlazione di 0,30 è un risultato solido nella ricerca sulla personalità e una base debole per una decisione su una singola persona. Entrambe le affermazioni sono vere, e il divario tra di esse è la causa principale dell'uso improprio dei risultati dei test.
- Lo screening non è una diagnosiUn questionario di screening è concepito per intercettare il maggior numero possibile di casi, accettando un alto tasso di falsi positivi come prezzo da pagare. Interpretare un punteggio di screening come una diagnosi inverte lo scopo per cui è stato progettato.