Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiables
Non pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
Un test de personnalité gratuit en ligne et un instrument psychométrique validé produisent des résultats qui semblent identiques : un score, un percentile, un paragraphe qui vous décrit. La différence réside entièrement dans un travail que vous ne pouvez pas voir depuis l'écran des résultats.
Cela mérite d'être précisé, car le cadrage habituel — selon lequel les tests internet sont des arnaques — est en grande partie erroné et peu utile. La plupart sont créés par des personnes sans intention de tromper. Ils sont peu fiables pour des raisons structurelles.
Ce qui est généralement omis
L'analyse des items. Dans une échelle correctement construite, la plupart des items rédigés sont écartés après le pilotage : les items sur lesquels personne ne varie, ceux qui corrèlent mal avec le total, ceux qui saturent sur plus d'un facteur, ceux qui se comportent différemment selon les groupes d'âge ou de langue. Un test rédigé et publié sans pilotage a tout conservé, y compris les items qui ne fonctionnent pas.
La confirmation structurelle indépendante. Une analyse factorielle sur les données à partir desquelles vous avez construit l'échelle retrouvera la structure que vous avez conçue. La confirmer sur un nouvel échantillon est une étude distincte, et c'est l'étape à laquelle une grande partie des échelles échouent.
Les normes. Le percentile doit bien venir de quelque part. Si le site n'indique pas sa population de référence, le chiffre est dérivé soit des visiteurs précédents — un groupe autoselectionné de composition inconnue — soit de rien de particulier.
Les données test-retest. Établir que les personnes obtiennent le même score le mois suivant nécessite de les retrouver. Presque personne ne le fait, ce qui signifie que la stabilité qu'implique le mot « trait » n'a pas été démontrée.
Les incitations à la conception vont dans le mauvais sens
Un test conçu pour l'engagement est optimisé pour un résultat différent d'un test conçu pour la précision, et les deux divergent de manière prévisible.
Les résultats flatteurs fonctionnent mieux. Un résultat qui vous apprend quelque chose de désagréable est moins partagé, de sorte que les résultats dérivent vers des descriptions que tout le monde reconnaît en soi-même. C'est l'effet Barnum, démontré dans les années 1940 et reproduit de manière fiable depuis : les personnes évaluent des descriptions de personnalité génériques comme très précises à leur sujet spécifiquement.
Les typologies fonctionnent mieux que les dimensions. « Vous êtes un Architecte » est plus facile à partager que « vous vous situez au 68e percentile en ouverture d'esprit avec un large intervalle de confiance ». Les typologies dissimulent également l'erreur de mesure, car une personne se trouvant d'un point de chaque côté d'une limite catégorielle reçoit des étiquettes entièrement différentes.
La brièveté fonctionne mieux que l'adéquation. Chaque question supplémentaire fait perdre des répondants, de sorte que les tests sont réduits à une longueur qui maximise le taux de complétion plutôt qu'une longueur qui couvre le construit.
Nil n'y a là aucun mensonge. Il s'agit d'une optimisation pour une métrique autre que la précision.
Comment le déterminer en une trentaine de secondes
Cherchez un instrument source nommé avec des auteurs et une année. Cherchez une déclaration indiquant de quelle population proviennent les normes. Cherchez toute reconnaissance des limites ou de l'erreur de mesure. Vérifiez si le résultat est un score continu ou une catégorie. Vérifiez si la même page promet également d'identifier votre carrière idéale, votre partenaire ou votre raison de vivre à partir de vingt questions.
Un test qui nomme son instrument, cite sa source, énonce ses normes et indique ce qu'il ne peut pas vous dire a accompli le travail nécessaire. Celui qui ne fait rien de tout cela peut tout de même être une façon agréable de passer cinq minutes — mais le chiffre qu'il produit n'est que décoratif.
Chaque instrument du catalogue NOESIS indique quel test publié il met en œuvre, qui l'a rédigé, en quelle année, comment il est scoré, et ce que ses résultats n'établissent pas. Cette dernière partie est celle qui mérite d'être comparée.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la fidélité en psychométrie ?La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
- Qu'est-ce que la validité dans les tests psychologiques ?La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
- Qu'est-ce que la validité de construit ?La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
- Validité convergente et discriminanteDeux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
- Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pasLa statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
- Erreur type de mesure : dans quelle mesure votre score peut-il être inexactTout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Comment un test psychométrique est réellement construitDe la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
- Que signifie dire qu'un test est validé ?Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.