noesisnoesis
Comment on mesure

Erreur type de mesure : dans quelle mesure votre score peut-il être inexact

Tout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.

L'erreur type de mesure convertit un coefficient de fidélité abstrait en quelque chose de concret : une plage de plus ou moins autour d'un score. Elle répond à la question que la plupart des écrans de résultats laissent sans réponse — dans quelle mesure ce chiffre aurait-il pu différer si j'avais passé le test un autre après-midi ?

La formule est simple. Multipliez l'écart type de l'échelle par la racine carrée de un moins sa fidélité. Pour une échelle avec un écart type de 10 et une fidélité de 0,85, l'erreur type est d'environ 3,9 points.

Ce que cette plage couvre réellement

Environ deux tiers du temps, la position réelle d'une personne se situe à moins d'une erreur type de son score observé. Pour avoir environ 95 % de confiance, il faut approximativement deux erreurs types de chaque côté.

Prenons l'exemple ci-dessus. Quelqu'un obtient 62. L'intervalle à 95 % s'étend d'environ 54 à 70. C'est une fenêtre de seize points sur une échelle où l'écart typique entre la moyenne et nettement au-dessus de la moyenne pourrait être de dix points.

Ce n'est pas un défaut de ce test particulier. Une fidélité de 0,85 est respectable. C'est la précision normale de la mesure psychologique, et c'est la raison pour laquelle les rapports rigoureux présentent des plages plutôt que des points.

Les conséquences que les gens ne voient pas

Les petites différences entre échelles sont généralement sans signification. Si votre extraversion est à 58 et votre ouverture à 54, la lecture honnête est qu'elles sont indiscernables. Les interprétations de profil qui construisent un récit à partir d'écarts de quatre points lisent du bruit.

Les petits changements dans le temps sont généralement sans signification aussi. Repasser un test et gagner cinq points se situe dans la marge d'erreur pour la plupart des instruments. Le vrai changement de trait se produit sur des années et se manifeste par un mouvement bien au-delà de la plage d'erreur, et non par quelques points d'un mois à l'autre.

Les classements amplifient le problème. Une différence de quelques points bruts peut faire progresser quelqu'un de dix rangs percentiles dans la partie dense du milieu d'une distribution, car c'est là que se situe la majorité des personnes. Les rangs percentiles semblent précis et constituent la façon la moins stable d'exprimer un score.

La précision n'est pas uniforme sur toute l'échelle. La théorie classique des tests suppose une valeur d'erreur unique pour chaque score, ce qui est une simplification. La théorie de réponse à l'item modélise l'erreur séparément à chaque niveau du trait, et elle est presque toujours plus grande aux extrêmes — précisément là où se font les interprétations les plus conséquentes. Un score très élevé ou très faible est généralement moins précis qu'un score moyen, et non plus précis.

Pourquoi un rapport honnête semble moins impressionnant

Un instrument qui présente des plages de confiance paraît plus vague qu'un instrument qui affiche un seul chiffre avec une décimale. Le plus vague dit la vérité. Celui qui semble précis présente la même erreur sous-jacente et a choisi de ne pas la montrer.

Cela vaut la peine de s'en souvenir lorsqu'on compare un test scientifiquement documenté avec un produit commercial qui vous assigne à une catégorie. La frontière de catégorie se situe à un score précis, et une personne un point en dessous et une personne un point au-dessus sont, statistiquement, la même personne. L'étiquette de type dissimule cela entièrement — ce qui constitue l'un des arguments les plus sérieux contre les instruments basés sur les types, et la raison pour laquelle les scores continus avec une erreur déclarée constituent la norme en recherche.

Mettez-le à l'épreuve

Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.

À lire ensuite