Validité convergente et discriminante
Deux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
La validité convergente et la validité discriminante constituent les deux moitiés d'une seule et même exigence. Une mesure doit être corrélée avec ce qu'elle devrait théoriquement l'être, et ne doit pas être trop fortement corrélée avec ce dont elle est censée se distinguer. Satisfaire l'une sans l'autre n'est pas un demi-succès ; c'est généralement le signe que le construit n'est pas ce qu'il prétend être.
Validité convergente
Les données convergentes montrent qu'une mesure s'aligne sur d'autres indicateurs du même phénomène. Une nouvelle échelle d'anxiété devrait être substantiellement corrélée avec des échelles d'anxiété établies, avec des évaluations cliniciennes, et — idéalement — avec quelque chose qui n'est pas un autre questionnaire, comme des mesures physiologiques ou des comportements d'évitement observés.
Les corrélations attendues ici dépassent généralement 0,50, souvent 0,70 lorsque la mesure de comparaison est un instrument bien établi pour le même construit. En dessous de ce seuil, soit la nouvelle échelle, soit la mesure de comparaison mesure autre chose.
Il existe un piège. Une corrélation de 0,95 avec une échelle existante n'est pas un triomphe — cela signifie que le nouvel instrument est un reconditionnement, et la vraie question devient celle de sa valeur ajoutée. La validité convergente est un plancher, non une cible à maximiser.
Validité discriminante
Les données discriminantes montrent que la mesure reste distincte des construits dont elle prétend différer. C'est là que résident les échecs les plus révélateurs.
Le même schéma revient dans la littérature. La persévérance est corrélée à environ 0,84 avec la conscienciosité, une proximité telle que la méta-analyse a révélé qu'elle n'apporte presque rien à la prédiction académique une fois la conscienciosité contrôlée. L'intelligence émotionnelle auto-rapportée recoupe largement la stabilité émotionnelle, l'extraversion et la conscienciosité combinées. La variance partagée au sein de la Triade Sombre disparaît en grande partie dès lors que l'on prend en compte l'Honnêteté-Humilité du modèle HEXACO. Dans chaque cas, le construit était présenté comme un territoire nouveau et s'est révélé n'être qu'une région renommée d'une carte existante.
La validité discriminante est également là où les effets de méthode font surface. Si chaque construit auto-rapporté dans une étude est corrélé à 0,4 avec tous les autres, le facteur commun est probablement le style de réponse du répondant plutôt qu'une quelconque psychologie partagée.
Le test décisif
La procédure décisive est la validité incrémentielle : on introduit d'abord la mesure établie dans une régression, puis la nouvelle, et on vérifie si cette dernière explique une part supplémentaire de variance dans le critère. Si ce n'est pas le cas, le construit peut rester théoriquement intéressant, mais l'instrument ne mesure rien que le domaine ne possédait pas déjà.
C'est une norme exigeante, et un grand nombre d'échelles publiées n'y ont jamais été soumises. Lorsqu'elles le sont, le résultat est fréquemment celui de la redondance mentionnée plus haut. Ce n'est pas un scandale — c'est un élagage scientifique normal — mais cela signifie que la popularité d'un construit n'indique rien quant à sa capacité à survivre à ce test.
Ce que cela change pour le lecteur
Lorsqu'un test rapporte plusieurs scores, la question utile est de savoir si ces scores sont réellement distincts. Quatre dimensions corrélées à 0,8 entre elles n'en forment qu'une seule avec quatre étiquettes, et un profil construit à partir d'elles paraîtra différencié tout en ne portant presque aucune information indépendante.
Les instruments qui rapportent leurs corrélations inter-échelles vous permettent de vérifier cela par vous-même. Les instruments qui présentent une typologie en quatre quadrants sans jamais montrer comment ces quadrants sont liés ont rendu cette vérification impossible, ce qui est généralement le but recherché.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la fidélité en psychométrie ?La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
- Qu'est-ce que la validité dans les tests psychologiques ?La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
- Qu'est-ce que la validité de construit ?La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
- Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pasLa statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
- Erreur type de mesure : dans quelle mesure votre score peut-il être inexactTout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Comment un test psychométrique est réellement construitDe la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
- Que signifie dire qu'un test est validé ?Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
- Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiablesNon pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.