Qu'est-ce que la validité de construit ?
La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
La validité de construit interroge la capacité d'un instrument à mesurer le construit théorique qu'il prétend évaluer, plutôt que quelque chose qui lui est corrélé, quelque chose de plus étroit, ou rien de cohérent du tout. C'est la forme la plus profonde de preuve de validité, celle qui demande des années plutôt qu'une seule étude pour être établie.
La difficulté est structurelle. Un construit tel que la résilience ou l'intelligence émotionnelle n'est pas un objet ; c'est une régularité supposée du comportement. Pour démontrer qu'une échelle le mesure, il faut simultanément défendre l'idée que le construit existe tel qu'il est décrit et que ces items précis l'atteignent. Ces deux affirmations ne peuvent être séparées, ce qui explique pourquoi Cronbach et Meehl, qui ont introduit ce concept en 1955, l'ont formulé comme la mise à l'épreuve d'un réseau théorique entier plutôt que d'un seul instrument.
Comment l'argument est construit
Patterns de corrélation prédits. La théorie indique à quoi le construit devrait être lié et avec quelle intensité. L'autocompassion devrait être positivement corrélée à la satisfaction de vie, négativement à la dépression, et seulement modérément à l'estime de soi — une corrélation de 0,9 avec l'estime de soi signifierait que ce n'est pas un construit distinct. Chacune de ces prédictions est une affirmation vérifiable, et en réfuter une est instructif.
Différences entre groupes attendues. Si la théorie affirme qu'un trait se développe avec l'âge, ou qu'il est élevé dans une population clinique, l'instrument devrait le montrer. Ne pas trouver une différence que la théorie exige constitue une preuve contre l'instrument, la théorie, ou les deux.
Réponse à l'intervention. Si un construit est censé être entraînable, les scores devraient évoluer après l'entraînement et rester stables dans un groupe contrôle. Les construits qui ne répondent jamais à rien sont difficiles à distinguer d'artefacts.
Structure interne. La structure factorielle devrait correspondre à la structure théorisée — et, fait important, sur un nouvel échantillon. L'analyse factorielle exploratoire appliquée aux données de développement trouvera la structure qui y a été conçue ; c'est l'analyse confirmatoire sur de nouvelles données qui met véritablement l'affirmation à l'épreuve.
Le concept multitraits-multiméthodes
La contribution de Campbell et Fiske en 1959 fut d'insister sur le fait que la validité de construit exige deux choses à la fois : les mesures d'un même trait par différentes méthodes doivent converger, et les mesures de traits différents par la même méthode ne doivent pas converger.
C'est cette seconde exigence qui pose problème à la plupart des instruments. Si votre empathie autodéclarée est corrélée à 0,7 avec votre agréabilité autodéclarée et à 0,2 avec l'empathie évaluée par un observateur, ce que votre questionnaire mesure le plus fortement n'est pas l'empathie — c'est votre façon générale de vous décrire dans les questionnaires. La variance de méthode est l'un des problèmes les plus persistants dans la recherche par auto-évaluation, et c'est pourquoi un travail de validation sérieux cherche autant que possible un critère ne reposant pas sur un questionnaire.
Pourquoi cela importe lors de la lecture de vos résultats
La validité de construit est ce qui relie un score à son interprétation. Lorsqu'un instrument bien validé indique que vous obtenez un score élevé sur un trait, la chaîne de raisonnement derrière cette affirmation inclut des décennies de travaux publiés établissant que le trait se comporte comme une quantité cohérente, que ces items le suivent, et que le score a une signification similaire pour les différentes personnes qui y répondent.
Lorsqu'un test sans validation de construit rapporte la même chose, le score est un nombre généré par un algorithme que personne n'a vérifié. Les deux se ressemblent à l'écran de résultats. La différence réside entièrement dans la documentation, ce qui explique pourquoi il vaut la peine de la rechercher.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la fidélité en psychométrie ?La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
- Qu'est-ce que la validité dans les tests psychologiques ?La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
- Validité convergente et discriminanteDeux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
- Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pasLa statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
- Erreur type de mesure : dans quelle mesure votre score peut-il être inexactTout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Comment un test psychométrique est réellement construitDe la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
- Que signifie dire qu'un test est validé ?Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
- Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiablesNon pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.