Que signifie dire qu'un test est validé ?
Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
« Scientifiquement validé » n'est pas une expression protégée. Personne ne la certifie, aucun organisme ne l'audite, et elle figure sur des produits dont l'unique base de preuves est qu'un grand nombre de personnes les ont utilisés. Il est utile de savoir ce qu'elle signifie lorsqu'elle est employée correctement.
En résumé
Un instrument validé dispose d'un dossier publié montrant ce qu'il mesure, avec quelle précision, dans quelles populations, et à quelles fins ses scores peuvent légitimement être utilisés. La validation n'est pas un certificat. C'est un ensemble de preuves, généralement constitué sur plusieurs années, qui comprend habituellement des résultats limitant l'utilisation de l'instrument plutôt que le flattant.
La présence de limites documentées est l'un des meilleurs indicateurs. La littérature de validation authentique en est pleine : cette échelle est peu performante chez les adolescents, telle facette ne se reproduit pas, le seuil dépend de la population. Un produit qui ne rapporte que des points forts n'a pas publié sa validation ; il a publié son marketing.
Quatre questions essentielles
Quelle est la publication source ? Un instrument validé fait l'objet d'un article original dans une revue à comité de lecture, avec des auteurs, une année et généralement un DOI. Cet article indique comment les items ont été développés et quelles étaient les propriétés psychométriques initiales. Si personne ne peut citer l'article, il n'y a aucune validation à discuter.
La structure a-t-elle été confirmée par d'autres chercheurs ? L'équipe de développement retrouvera la structure qu'elle a conçue. Ce qui importe, c'est qu'un groupe indépendant, avec des données indépendantes, ait obtenu les mêmes résultats. C'est la question la plus informative que vous puissiez poser, et celle qui reste le plus souvent sans réponse.
Sur quelle population les normes ont-elles été établies, et à quelle époque ? Un score est une position dans une distribution de référence. Un instrument qui indique un percentile sans préciser la population de référence vous fournit un chiffre sans dénominateur.
Quelle est sa valeur ajoutée ? La validité incrémentielle par rapport à une mesure établie. Un grand nombre de construits de marque échouent ici, corrélant si fortement avec un trait existant qu'ils n'expliquent aucune variance supplémentaire. C'est un résultat normal de l'examen scientifique, et il reste invisible tant que personne ne réalise le test.
Les complications liées à la traduction
Un instrument validé en anglais n'est pas pour autant validé en allemand. Une adaptation interculturelle rigoureuse requiert une traduction directe et inversée, une révision par des experts, des entretiens cognitifs, puis une nouvelle étude psychométrique dans la nouvelle langue vérifiant si la structure factorielle se maintient et si les items individuels fonctionnent de manière équivalente entre les groupes.
Les instruments qui font l'impasse sur cette démarche sont courants. Un questionnaire dont la validation originale est irréprochable peut se comporter très différemment dans une langue où un item clé porte une connotation différente, et il est impossible de le savoir sans l'étude. Lorsqu'un test est proposé en dix langues, la question pertinente est de savoir s'il a été validé dans dix langues ou validé dans une seule et traduit dans neuf autres.
Ce que la validation ne garantit pas
Elle ne rend pas un score certain. Un instrument validé comporte toujours une erreur de mesure, décrit toujours une régularité au niveau de la population plutôt qu'une destinée individuelle, et ne mesure que ce que ses items permettent d'atteindre.
Ce que la validation apporte, ce sont des limites connaissables. Vous pouvez déterminer l'ampleur de l'erreur, dans quelle population, et à quelle fin. C'est une affirmation plus modeste que « ce test révèle qui vous êtes vraiment », et c'est la seule qui résiste à l'examen.
Si vous souhaitez voir à quoi ressemble la documentation lorsqu'elle existe, chaque test du catalogue NOESIS indique l'instrument qu'il met en œuvre, ses auteurs et son année, sa méthode de notation, ainsi que les preuves sur lesquelles il s'appuie — y compris là où ces preuves sont contestées.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la fidélité en psychométrie ?La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
- Qu'est-ce que la validité dans les tests psychologiques ?La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
- Qu'est-ce que la validité de construit ?La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
- Validité convergente et discriminanteDeux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
- Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pasLa statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
- Erreur type de mesure : dans quelle mesure votre score peut-il être inexactTout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Comment un test psychométrique est réellement construitDe la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
- Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiablesNon pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.