Qu'est-ce que la fidélité en psychométrie ?
La fidélité désigne la cohérence de la mesure, non son exactitude. Un test peut être très fidèle et mesurer néanmoins la mauvaise chose — c'est pourquoi c'est la première question que l'on pose, et jamais la dernière.
La fidélité est le degré auquel une mesure est reproductible plutôt qu'aléatoire. Si vous vous pesiez trois fois en une minute et obteniez 71, 78 et 66 kilogrammes, la balance serait peu fiable — et il vous serait impossible de connaître votre poids réel à partir d'elle. La mesure psychologique se heurte au même problème avec des instruments bien moins précis.
Ce qu'il est essentiel de comprendre à propos de la fidélité, c'est ce qu'elle ne garantit pas. Une balance qui affiche systématiquement huit kilogrammes de trop est parfaitement fidèle et totalement fausse. La fidélité concerne la cohérence ; que le chiffre mesure la bonne chose est une question distincte, appelée validité. La fidélité est nécessaire à la validité, mais loin d'en être suffisante.
Les différentes formes
La cohérence interne examine si les items d'une échelle concordent entre eux. Si dix questions sont toutes censées mesurer le même trait sous-jacent, les personnes qui répondent fortement à l'une devraient tendre à répondre fortement aux autres. Elle est généralement rapportée par le coefficient alpha de Cronbach ou, de préférence, l'oméga de McDonald.
La fidélité test-retest examine si la même personne obtient des scores similaires à deux moments différents. C'est la forme la plus importante pour les traits de personnalité, qui sont par définition supposés être stables. C'est aussi la forme la plus souvent omise dans les rapports, car elle exige de retrouver les mêmes participants plusieurs semaines plus tard.
La fidélité inter-juges s'applique lorsque des humains cotent l'instrument — entretiens cliniques, techniques projectives, observation comportementale. Elle examine si deux évaluateurs formés, examinant le même matériau, parviennent à la même conclusion.
La fidélité des formes parallèles examine si deux versions différentes d'un même test, conçues pour être équivalentes, produisent les mêmes scores. Elle importe chaque fois qu'un test est administré plus d'une fois et que l'exposition aux items constitue un problème.
Lire les chiffres
Les coefficients de fidélité varient de 0 à 1. Les conventions sont approximatives et souvent mal utilisées, mais grossièrement : au-dessus de 0,90 est requis lorsqu'un score influe sur la vie d'un individu ; de 0,80 à 0,90 est solide pour la plupart des usages appliqués ; de 0,70 à 0,80 est acceptable pour la recherche et les comparaisons de groupes ; en dessous de 0,70, le score contient trop de bruit pour que la plupart des conclusions soient défendables.
Deux mises en garde concernant ces seuils. Premièrement, ce sont des conventions, non des lois — le niveau acceptable dépend entièrement de l'usage auquel le score sera destiné. Deuxièmement, un alpha très élevé sur une échelle courte indique généralement que les items sont de quasi-paraphrases les uns des autres, ce qui achète la cohérence au prix d'une couverture restreinte du construit. Une échelle de dix questions qui demandent toutes « êtes-vous organisé ? » en des termes légèrement différents présentera une excellente cohérence interne et une lecture étroite de la conscience.
Ce que cela signifie pour votre propre score
La fidélité se traduit directement par le degré de confiance qu'un seul chiffre mérite. Un test ayant une fidélité de 0,85 comporte une erreur de mesure suffisamment grande pour qu'une différence de quelques points entre deux personnes, ou entre votre score d'aujourd'hui et celui du mois dernier, soit très probablement du bruit plutôt qu'un signal.
C'est la conséquence pratique : un bon instrument rapporte sa fidélité afin que vous sachiez quelle est l'étendue de l'incertitude autour de votre score. L'expression technique de cette incertitude est l'erreur type de mesure, qui convertit un coefficient de fidélité en une marge plus-ou-moins autour du score.
Un instrument qui ne rapporte aucun coefficient de fidélité n'est pas pour autant plus précis. Il a simplement refusé de vous dire à quel point il est imprécis.
Mettez-le à l'épreuve
Lire sur la mesure est une chose. Voir son propre score avec sa source, son échantillon normatif et ses limites en est une autre. Gratuit, sans inscription.
À lire ensuite
- Qu'est-ce que la psychométrie ?La discipline qui détermine si une mesure psychologique est valable — et la raison pour laquelle deux tests posant des questions similaires peuvent différer énormément quant à la valeur de leurs résultats.
- Qu'est-ce que la validité dans les tests psychologiques ?La validité n'est pas une propriété que possède un test. C'est un argument sur la question de savoir si une interprétation particulière d'un score particulier, pour un objectif particulier, est défendable — et elle doit être reconstruite pour chaque nouvel usage.
- Qu'est-ce que la validité de construit ?La question la plus difficile en matière de mesure : savoir si ce que vous mesurez existe tel que vous l'avez défini, et si votre instrument l'atteint plutôt que quelque chose d'adjacent.
- Validité convergente et discriminanteDeux exigences en miroir : une mesure doit concorder avec ce avec quoi elle devrait concorder, et doit rester distincte de ce qu'elle prétend ne pas être. La plupart des instruments faibles échouent sur le second point.
- Ce qu'est l'alpha de Cronbach — et ce qu'il n'est pasLa statistique la plus rapportée en psychométrie, et la plus mal interprétée. L'alpha ne vous dit pas qu'une échelle est unidimensionnelle, et une valeur élevée est souvent un symptôme plutôt qu'une vertu.
- Erreur type de mesure : dans quelle mesure votre score peut-il être inexactTout score comporte une marge d'erreur, et pour la plupart des tests psychologiques, elle est plus large que ce que les gens supposent. C'est ce chiffre qui vous indique quand une différence est réelle et quand elle n'est que du bruit.
- Normes et percentiles : ce à quoi votre score est comparéUn score brut est inexploitable en lui-même. Il ne prend de sens qu'en référence à un groupe étalon — et le choix de ce groupe est l'un des faits les plus déterminants et les moins publicisés concernant tout test.
- Comment un test psychométrique est réellement construitDe la définition du construit aux normes publiées, le processus prend des années et écarte la majeure partie de ce qui y est investi. Connaître les étapes permet de voir immédiatement lesquelles un quiz en ligne rapide a omises.
- Que signifie dire qu'un test est validé ?Le terme n'est pas réglementé et est utilisé librement par des produits qui n'ont accompli aucun des travaux nécessaires. Voici ce qu'il signifie lorsqu'il a un sens, et les quatre questions qui permettent de distinguer les deux cas.
- Pourquoi la plupart des tests de personnalité en ligne ne sont pas fiablesNon pas parce qu'ils sont malhonnêtes, mais parce que les étapes qui rendent une mesure digne de confiance sont invisibles, coûteuses et faciles à ignorer — et les ignorer ne change rien à l'apparence du résultat.
- Ce que les auto-évaluations peuvent et ne peuvent pas mesurerLes questionnaires vous demandent d'être l'observateur de vous-même, ce qui fonctionne mieux pour certaines choses que pour d'autres. Savoir où la méthode est solide et où elle échoue change la façon dont vous interprétez n'importe quel résultat.
- Ce que signifie qu'un test prédit quelque choseUne corrélation de 0,30 est un résultat solide en recherche sur la personnalité et une base fragile pour prendre une décision concernant une personne en particulier. Ces deux affirmations sont vraies, et l'écart entre elles est à l'origine de la plupart des mauvaises utilisations des résultats de tests.
- Le dépistage n'est pas un diagnosticUn questionnaire de dépistage est conçu pour détecter le plus grand nombre de cas possible, en acceptant un taux élevé de faux positifs comme contrepartie. Interpréter un score de dépistage comme un diagnostic va à l'encontre de ce pour quoi il a été conçu.