Comment un test psychométrique est réellement construit
De la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
Un instrument psychométrique qui parvient à la publication a généralement traversé cinq ou six ans de travail et éliminé la majeure partie de ce qui avait été rédigé pour lui. Le processus mérite d'être connu, car chacune de ses étapes correspond à une façon dont un test peut être inadéquat.
1. Définir le construit
Avant qu'un seul item soit rédigé, le construit doit être spécifié avec suffisamment de précision pour déterminer ce qui en est exclu. Cela implique une définition, un énoncé de la structure dimensionnelle — une dimension ou plusieurs, et si plusieurs, la façon dont elles s'articulent — ainsi qu'une description explicite des construits voisins dont il doit se distinguer.
Omettre cette étape est à l'origine de la plupart des instruments redondants. Une échelle construite à partir d'une intuition d'un concept finit généralement par mesurer un trait établi sous un nouveau nom.
2. Générer un bassin d'items
Les items sont rédigés en nombre bien supérieur à ce qui survivra — généralement trois à cinq fois le nombre final. Ils proviennent de la théorie, d'instruments existants, d'entretiens avec des personnes ayant vécu l'expérience décrite, et d'experts du domaine.
À cette étape, le bassin est examiné pour la couverture du contenu (couvre-t-il l'ensemble du construit ou se concentre-t-il sur une seule facette ?), pour le niveau de lecture, pour les formulations à double sens, et pour les items qui portent en réalité sur autre chose.
3. Pilote et élagage
Le bassin est soumis à un premier échantillon. L'analyse est essentiellement destructrice.
Les items à variance quasi nulle sont éliminés — une question à laquelle tout le monde répond de la même façon ne distingue personne. Les items qui corrèlent faiblement avec le score total sont éliminés. Les items qui saturent sur plus d'un facteur sont éliminés. Les items qui se comportent différemment selon les groupes démographiques pour des raisons sans rapport avec le trait — le fonctionnement différentiel des items — sont éliminés, et cette vérification est l'une des plus fréquemment omises.
Ce qui survit représente généralement un tiers de ce qui avait été rédigé.
4. Confirmer la structure sur un nouvel échantillon
C'est l'étape qui sépare les instruments sérieux des autres. L'analyse factorielle sur l'échantillon de développement retrouvera nécessairement la structure qui y avait été intégrée — elle le doit, puisque les items ont été sélectionnés pour la produire. Le véritable test est l'analyse factorielle confirmatoire sur un échantillon indépendant.
Un grand nombre d'échelles publiées ne retrouvent leur structure attendue que dans les données ayant servi à les construire. Lorsque d'autres chercheurs collectent de nouvelles données, les facteurs n'apparaissent pas. Cet échec est suffisamment fréquent pour que « la structure a-t-elle été confirmée sur un échantillon indépendant ? » soit l'une des questions les plus efficaces à poser sur n'importe quel instrument.
5. Accumuler des preuves de validité
Correlations avec des mesures établies du même construit. Corrélations avec des construits dont il devrait se distinguer, qui doivent être plus faibles. Relations avec des résultats significatifs. Validité incrémentielle par rapport à ce qui existe déjà. Stabilité test-retest sur un intervalle approprié au construit.
Cette étape ne se termine pas. Elle se poursuit aussi longtemps que l'instrument est en usage, et c'est là que les instruments sont le plus souvent jugés insuffisants des années après leur publication.
6. Construire les normes
Un échantillon de référence suffisamment large et représentatif de la population visée, stratifié lorsque le trait varie selon l'âge ou le sexe, documenté quant à l'année et au pays. Puis renouvelé périodiquement, car les normes évoluent.
7. Traduire, si l'instrument doit être utilisé ailleurs
La traduction n'est pas un exercice linguistique. Une adaptation rigoureuse implique une traduction directe, une retraduction indépendante, une révision par des experts, des entretiens cognitifs avec des locuteurs de la langue cible, puis une étude psychométrique complète dans la nouvelle langue pour vérifier si la structure tient et si les items fonctionnent de manière équivalente. Un instrument traduit sans cette étude est un instrument non validé dans cette langue, quelles que soient ses accréditations dans la langue d'origine.
Ce que cela implique concernant le quiz rapide
Un test rédigé en une après-midi a accompli l'étape deux. Il produira vraisemblablement un résultat d'apparence plausible — un percentile et un paragraphe descriptif. Les étapes qu'il a omises sont précisément celles qui auraient permis d'établir si tout cela signifie quoi que ce soit.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la fidélité en psychométrie ?La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
- Qu'est-ce que la validité dans les tests psychologiques ?La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
- Qu'est-ce que la validité de construit ?La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
- Validité convergente et discriminanteDeux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
- Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pasLa statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
- Erreur type de mesure : dans quelle mesure votre score peut-il être inexactTout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Que signifie dire qu'un test est validé ?Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
- Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiablesNon pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.