Erreur type de mesure : dans quelle mesure votre score peut-il être inexact
Tout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
L'erreur type de mesure convertit un coefficient de fidélité abstrait en quelque chose de concret : une plage de plus ou moins autour d'un score. Elle répond à la question que la plupart des écrans de résultats laissent sans réponse — dans quelle mesure ce chiffre aurait-il pu différer si j'avais passé le test un autre après-midi ?
La formule est simple. Multipliez l'écart type de l'échelle par la racine carrée de un moins sa fidélité. Pour une échelle avec un écart type de 10 et une fidélité de 0,85, l'erreur type est d'environ 3,9 points.
Ce que cette plage couvre réellement
Environ deux tiers du temps, la position réelle d'une personne se situe à moins d'une erreur type de son score observé. Pour avoir environ 95 % de confiance, il faut approximativement deux erreurs types de chaque côté.
Prenons l'exemple ci-dessus. Quelqu'un obtient 62. L'intervalle à 95 % s'étend d'environ 54 à 70. C'est une fenêtre de seize points sur une échelle où l'écart typique entre la moyenne et nettement au-dessus de la moyenne pourrait être de dix points.
Ce n'est pas un défaut de ce test particulier. Une fidélité de 0,85 est respectable. C'est la précision normale de la mesure psychologique, et c'est la raison pour laquelle les rapports rigoureux présentent des plages plutôt que des points.
Les conséquences que les gens ne voient pas
Les petites différences entre échelles sont généralement sans signification. Si votre extraversion est à 58 et votre ouverture à 54, la lecture honnête est qu'elles sont indiscernables. Les interprétations de profil qui construisent un récit à partir d'écarts de quatre points lisent du bruit.
Les petits changements dans le temps sont généralement sans signification aussi. Repasser un test et gagner cinq points se situe dans la marge d'erreur pour la plupart des instruments. Le vrai changement de trait se produit sur des années et se manifeste par un mouvement bien au-delà de la plage d'erreur, et non par quelques points d'un mois à l'autre.
Les classements amplifient le problème. Une différence de quelques points bruts peut faire progresser quelqu'un de dix rangs percentiles dans la partie dense du milieu d'une distribution, car c'est là que se situe la majorité des personnes. Les rangs percentiles semblent précis et constituent la façon la moins stable d'exprimer un score.
La précision n'est pas uniforme sur toute l'échelle. La théorie classique des tests suppose une valeur d'erreur unique pour chaque score, ce qui est une simplification. La théorie de réponse à l'item modélise l'erreur séparément à chaque niveau du trait, et elle est presque toujours plus grande aux extrêmes — précisément là où se font les interprétations les plus conséquentes. Un score très élevé ou très faible est généralement moins précis qu'un score moyen, et non plus précis.
Pourquoi un rapport honnête semble moins impressionnant
Un instrument qui présente des plages de confiance paraît plus vague qu'un instrument qui affiche un seul chiffre avec une décimale. Le plus vague dit la vérité. Celui qui semble précis présente la même erreur sous-jacente et a choisi de ne pas la montrer.
Cela vaut la peine de s'en souvenir lorsqu'on compare un test scientifiquement documenté avec un produit commercial qui vous assigne à une catégorie. La frontière de catégorie se situe à un score précis, et une personne un point en dessous et une personne un point au-dessus sont, statistiquement, la même personne. L'étiquette de type dissimule cela entièrement — ce qui constitue l'un des arguments les plus sérieux contre les instruments basés sur les types, et la raison pour laquelle les scores continus avec une erreur déclarée constituent la norme en recherche.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la fidélité en psychométrie ?La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
- Qu'est-ce que la validité dans les tests psychologiques ?La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
- Qu'est-ce que la validité de construit ?La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
- Validité convergente et discriminanteDeux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
- Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pasLa statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Comment un test psychométrique est réellement construitDe la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
- Que signifie dire qu'un test est validé ?Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
- Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiablesNon pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.