Qu'est-ce que la validité dans les tests psychologiques ?
La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
La validité interroge la capacité d'un test à mesurer ce qu'il prétend mesurer, et le bien-fondé des conclusions que les personnes tirent de ses scores. C'est la question centrale de la psychométrie, et celle à laquelle on répond le plus souvent par un argument commercial plutôt que par des données probantes.
La conception moderne, qui prévaut depuis les travaux de Messick dans les années 1980, est que la validité n'est pas un attribut fixe d'un instrument. C'est une propriété de l'interprétation des scores pour un usage spécifique. Un même questionnaire peut être bien validé pour décrire la perception qu'une personne a d'elle-même, et totalement non validé pour décider de la recruter. Dire « ce test est valide » sans préciser valide pour quoi n'est pas une affirmation ; c'est un slogan.
Les types de preuves
La validité se construit à partir d'un ensemble de preuves de plusieurs types. Les anciens manuels les présentaient comme des espèces distinctes de validité ; la conception actuelle les traite comme des arguments différents étayant un seul et même dossier.
Les preuves de contenu examinent si les items couvrent convenablement le construit. Une échelle de dépression qui ne porte que sur le sommeil et l'appétit couvre les symptômes somatiques en omettant les symptômes affectifs et cognitifs. La couverture du contenu est généralement appréciée par des experts du domaine, et c'est la raison pour laquelle les échelles très courtes constituent toujours un compromis.
Les preuves de structure interne examinent si les items se regroupent de la manière prévue par la théorie. Si un modèle postule quatre facettes distinctes, l'analyse factorielle devrait en extraire quatre — et, point crucial, sur un échantillon indépendant, et non sur celui ayant servi à construire l'échelle. De nombreux instruments retrouvent leur structure attendue sur l'échantillon de développement, puis échouent à le faire sur tout autre échantillon.
Les relations avec d'autres variables constituent le cœur du travail. Les preuves convergentes montrent que l'échelle est corrélée avec les variables avec lesquelles elle devrait l'être. Les preuves discriminantes montrent qu'elle n'est pas trop fortement corrélée avec des variables dont elle devrait se distinguer — une exigence chroniquement négligée, qui fait pourtant échouer bon nombre de construits nouvellement étiquetés. Les preuves critérielles montrent que le score est lié à un résultat important, mesuré simultanément ou prédit à l'avance.
Les preuves conséquentielles examinent ce qui se produit lors de l'utilisation du test. Si un instrument désavantage systématiquement un groupe pour des raisons sans rapport avec le construit, il s'agit d'un problème de validité, et pas seulement d'un problème éthique.
La question qui met à l'épreuve la plupart des affirmations
L'épreuve la plus rigoureuse d'une affirmation de validité est la validité incrémentielle : cet instrument apporte-t-il quelque chose au-delà de ce que révèle déjà une mesure plus ancienne, établie et moins coûteuse ?
Un nombre remarquable de construits sous marque échouent à ce test. Ils présentent des corrélations de 0,7 ou plus avec un domaine existant des Big Five, prédisent les mêmes résultats avec la même amplitude, et n'apportent rien une fois la mesure plus ancienne statistiquement contrôlée. Le construit est nouveau ; la mesure, elle, ne l'est pas. C'est pourquoi les sections critiques des documentations sérieuses d'instruments portent si souvent sur la redondance plutôt que sur l'inexactitude.
Ce qu'il faut rechercher
Lorsque quelqu'un affirme qu'un test est validé, les questions utiles sont concrètes. Validé par rapport à quel critère ? Dans quelle population, de quelle taille ? La structure factorielle a-t-elle été confirmée sur un échantillon indépendant ? Existe-t-il des preuves publiées par des chercheurs n'ayant aucun intérêt commercial dans la réponse ? Cela apporte-t-il quelque chose par rapport à une alternative établie ?
Un instrument dont les réponses à ces questions sont honnêtes mérite d'être pris au sérieux, y compris ses limites. Un instrument dont la validation se résume à une page de témoignages et à l'affirmation que des millions de personnes l'ont passé a répondu à une tout autre question — la popularité n'est pas une preuve, et le nombre de personnes ayant passé un test ne dit rien sur la signification de ses scores.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la fidélité en psychométrie ?La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
- Qu'est-ce que la validité de construit ?La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
- Validité convergente et discriminanteDeux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
- Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pasLa statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
- Erreur type de mesure : dans quelle mesure votre score peut-il être inexactTout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Comment un test psychométrique est réellement construitDe la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
- Que signifie dire qu'un test est validé ?Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
- Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiablesNon pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.