Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pas
La statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
L'alpha de Cronbach est un coefficient de cohérence interne : le degré auquel les items d'une échelle sont corrélés entre eux. Publié en 1951, c'est la statistique psychométrique la plus rapportée, et son omniprésence a dépassé son utilité.
L'alpha varie de 0 à 1 et est déterminé par deux facteurs : la corrélation moyenne entre les items, et le nombre d'items. Cette seconde dépendance est à l'origine de la plupart des malentendus.
Ce qu'un alpha élevé ne signifie pas
Il ne signifie pas que l'échelle mesure une seule chose. C'est l'erreur la plus courante. L'alpha peut être élevé pour une échelle comportant deux ou trois facteurs distincts, à condition que les items soient suffisamment corrélés dans l'ensemble. L'unidimensionnalité doit être établie par une analyse factorielle ; l'alpha ne peut pas l'établir et n'a jamais été conçu pour cela.
Il ne signifie pas que l'échelle est valide. L'alpha ne dit rien sur ce que les items mesurent. Vingt questions sur la pointure auraient une excellente cohérence interne et une validité nulle en tant que mesure de quoi que ce soit de psychologique.
Il ne signifie pas que l'échelle est bonne. Parce que l'alpha augmente avec le nombre d'items, une longue échelle composée d'items médiocres obtiendra un score supérieur à une courte échelle composée d'excellents items. Une échelle de quarante items avec une corrélation inter-items moyenne de 0,2 dépasse 0,90.
Un alpha très élevé est souvent un signal d'alarme. Au-delà d'environ 0,95, les items sont généralement quasi-paraphrastiques. Cela achète de la cohérence au prix de la couverture du construit : l'échelle mesure une facette étroite avec une grande précision et rate le reste du construit. C'est ce qu'on appelle le paradoxe d'atténuation, et c'est pourquoi davantage de cohérence n'est pas monotonement meilleure.
Ce qu'il suppose
L'alpha est une borne inférieure de la fidélité sous une hypothèse spécifique — la tau-équivalence, ce qui signifie que chaque item contribue également au trait sous-jacent. Les échelles réelles ne satisfont presque jamais à cette condition. Les items diffèrent par la force de leur saturation sur le facteur, et lorsque c'est le cas, l'alpha sous-estime la fidélité.
L'oméga de McDonald abandonne l'hypothèse de contribution égale et estime la fidélité à partir des saturations factorielles réelles. Les méthodologues le recommandent à la place de l'alpha depuis deux décennies. Les pratiques de publication ont été lentes à suivre, en grande partie parce que l'alpha est disponible en une seule ligne dans tous les logiciels statistiques, contrairement à l'oméga.
L'interpréter en pratique
Conventions approximatives : 0,70 et plus est acceptable pour la recherche comparant des groupes, 0,80 et plus pour un usage appliqué, 0,90 et plus lorsqu'un score influence une décision individuelle. Considérez ces valeurs comme des repères, non comme des seuils — le niveau requis dépend des enjeux de la décision que le score éclaire.
Les informations les plus utiles se trouvent généralement ailleurs dans le même article. La corrélation inter-items moyenne (entre 0,15 et 0,50 constitue une plage saine) vous indique si un alpha élevé provient de la qualité ou de la quantité des items. Le nombre d'items vous dit la même chose dans l'autre sens. La fidélité test-retest vous apprend quelque chose que l'alpha ne peut structurellement pas révéler : si le score est stable chez la même personne au fil du temps.
Une échelle ne rapportant que l'alpha a rapporté le plus facile des indices de fidélité à obtenir, et celui dont le seuil à atteindre est le moins exigeant.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la fidélité en psychométrie ?La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
- Qu'est-ce que la validité dans les tests psychologiques ?La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
- Qu'est-ce que la validité de construit ?La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
- Validité convergente et discriminanteDeux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
- Erreur type de mesure : dans quelle mesure votre score peut-il être inexactTout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Comment un test psychométrique est réellement construitDe la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
- Que signifie dire qu'un test est validé ?Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
- Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiablesNon pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.