noesisnoesis
Comment on mesure

Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiables

Non pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.

Un test de personnalité gratuit en ligne et un instrument psychométrique validé produisent des résultats qui semblent identiques : un score, un percentile, un paragraphe qui vous décrit. La différence réside entièrement dans un travail que vous ne pouvez pas voir depuis l'écran des résultats.

Cela mérite d'être précisé, car le cadrage habituel — selon lequel les tests internet sont des arnaques — est en grande partie erroné et peu utile. La plupart sont créés par des personnes sans intention de tromper. Ils sont peu fiables pour des raisons structurelles.

Ce qui est généralement omis

L'analyse des items. Dans une échelle correctement construite, la plupart des items rédigés sont écartés après le pilotage : les items sur lesquels personne ne varie, ceux qui corrèlent mal avec le total, ceux qui saturent sur plus d'un facteur, ceux qui se comportent différemment selon les groupes d'âge ou de langue. Un test rédigé et publié sans pilotage a tout conservé, y compris les items qui ne fonctionnent pas.

La confirmation structurelle indépendante. Une analyse factorielle sur les données à partir desquelles vous avez construit l'échelle retrouvera la structure que vous avez conçue. La confirmer sur un nouvel échantillon est une étude distincte, et c'est l'étape à laquelle une grande partie des échelles échouent.

Les normes. Le percentile doit bien venir de quelque part. Si le site n'indique pas sa population de référence, le chiffre est dérivé soit des visiteurs précédents — un groupe autoselectionné de composition inconnue — soit de rien de particulier.

Les données test-retest. Établir que les personnes obtiennent le même score le mois suivant nécessite de les retrouver. Presque personne ne le fait, ce qui signifie que la stabilité qu'implique le mot « trait » n'a pas été démontrée.

Les incitations à la conception vont dans le mauvais sens

Un test conçu pour l'engagement est optimisé pour un résultat différent d'un test conçu pour la précision, et les deux divergent de manière prévisible.

Les résultats flatteurs fonctionnent mieux. Un résultat qui vous apprend quelque chose de désagréable est moins partagé, de sorte que les résultats dérivent vers des descriptions que tout le monde reconnaît en soi-même. C'est l'effet Barnum, démontré dans les années 1940 et reproduit de manière fiable depuis : les personnes évaluent des descriptions de personnalité génériques comme très précises à leur sujet spécifiquement.

Les typologies fonctionnent mieux que les dimensions. « Vous êtes un Architecte » est plus facile à partager que « vous vous situez au 68e percentile en ouverture d'esprit avec un large intervalle de confiance ». Les typologies dissimulent également l'erreur de mesure, car une personne se trouvant d'un point de chaque côté d'une limite catégorielle reçoit des étiquettes entièrement différentes.

La brièveté fonctionne mieux que l'adéquation. Chaque question supplémentaire fait perdre des répondants, de sorte que les tests sont réduits à une longueur qui maximise le taux de complétion plutôt qu'une longueur qui couvre le construit.

Nil n'y a là aucun mensonge. Il s'agit d'une optimisation pour une métrique autre que la précision.

Comment le déterminer en une trentaine de secondes

Cherchez un instrument source nommé avec des auteurs et une année. Cherchez une déclaration indiquant de quelle population proviennent les normes. Cherchez toute reconnaissance des limites ou de l'erreur de mesure. Vérifiez si le résultat est un score continu ou une catégorie. Vérifiez si la même page promet également d'identifier votre carrière idéale, votre partenaire ou votre raison de vivre à partir de vingt questions.

Un test qui nomme son instrument, cite sa source, énonce ses normes et indique ce qu'il ne peut pas vous dire a accompli le travail nécessaire. Celui qui ne fait rien de tout cela peut tout de même être une façon agréable de passer cinq minutes — mais le chiffre qu'il produit n'est que décoratif.

Chaque instrument du catalogue NOESIS indique quel test publié il met en œuvre, qui l'a rédigé, en quelle année, comment il est scoré, et ce que ses résultats n'établissent pas. Cette dernière partie est celle qui mérite d'être comparée.

Mettez-le à l'épreuve

Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.

À lire ensuite