Qué es el alfa de Cronbach y qué no es
El estadístico más reportado en la evaluación psicológica y el más malinterpretado. El alfa no indica que una escala sea unidimensional, y un valor alto suele ser un síntoma más que una virtud.
El alfa de Cronbach es un coeficiente de consistencia interna: el grado en que los ítems de una escala se correlacionan entre sí. Publicado en 1951, es el estadístico psicométrico más reportado, y su ubicuidad ha superado su utilidad.
El alfa varía de 0 a 1 y está determinado por dos factores: la correlación promedio entre los ítems y el número de ítems. Esta segunda dependencia es la fuente de la mayor parte de los malentendidos.
Lo que un alfa alto no significa
No significa que la escala mida una sola cosa. Este es el error más común. El alfa puede ser alto en una escala con dos o tres factores distintos, siempre que los ítems se correlacionen suficientemente en conjunto. La unidimensionalidad debe establecerse mediante análisis factorial; el alfa no puede establecerla y nunca fue concebido para ello.
No significa que la escala sea válida. El alfa no dice nada sobre lo que miden los ítems. Veinte preguntas sobre el tamaño del calzado tendrían una excelente consistencia interna y ninguna validez como medida de cualquier constructo psicológico.
No significa que la escala sea buena. Dado que el alfa aumenta con el número de ítems, una escala larga de ítems mediocres superará en puntuación a una escala corta de ítems excelentes. Una escala de cuarenta ítems con una correlación inter-ítem promedio de 0,2 supera el 0,90.
Un alfa muy alto suele ser una señal de advertencia. Por encima de aproximadamente 0,95, los ítems son por lo general paráfrasis casi idénticas. Esto compra consistencia a costa de la cobertura del constructo: la escala mide una faceta muy estrecha con gran precisión y omite el resto del constructo. Esto se denomina paradoja de atenuación, y es la razón por la que más consistencia no es monotónicamente mejor.
Lo que asume
El alfa es una cota inferior de la fiabilidad bajo un supuesto específico: la tau-equivalencia, que implica que cada ítem contribuye igualmente al rasgo subyacente. Las escalas reales casi nunca satisfacen este supuesto. Los ítems difieren en la intensidad con que saturan el factor, y cuando esto ocurre, el alfa subestima la fiabilidad.
El omega de McDonald abandona el supuesto de contribución igual y estima la fiabilidad a partir de las saturaciones factoriales reales. Los metodólogos lo han recomendado por encima del alfa durante dos décadas. Las prácticas de reporte han tardado en seguir esta recomendación, en gran medida porque el alfa se obtiene con una sola línea en cualquier paquete estadístico y el omega no.
Cómo interpretarlo en la práctica
Convenciones aproximadas: 0,70 o más es aceptable para investigaciones que comparan grupos; 0,80 o más para uso aplicado; 0,90 o más cuando una puntuación influye en una decisión individual. Trátelas como orientación, no como umbrales: el nivel requerido depende de las consecuencias de la decisión que informa la puntuación.
Los datos más informativos suelen encontrarse en otras partes del mismo artículo. La correlación inter-ítem promedio (entre 0,15 y 0,50 es un rango saludable) indica si un alfa alto proviene de la calidad o de la cantidad de ítems. El número de ítems transmite lo mismo desde la dirección opuesta. La fiabilidad test-retest aporta algo que el alfa estructuralmente no puede: si la puntuación es estable en la misma persona a lo largo del tiempo.
Una escala que reporta únicamente el alfa ha reportado el más fácil de obtener de todos los índices de fiabilidad, y el menos exigente de superar.
Ponlo a prueba
Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.
Sigue leyendo
- ¿Qué es la psicometría?La disciplina que determina si una medición psicológica es válida y confiable, y la razón por la que dos pruebas que formulan preguntas similares pueden diferir enormemente en el valor de sus resultados.
- ¿Qué es la fiabilidad en las pruebas psicológicas?La fiabilidad es la consistencia de la medición, no su exactitud. Una prueba puede ser muy fiable y aun así medir algo equivocado, razón por la cual es la primera pregunta que se formula y nunca la última.
- ¿Qué es la validez en las pruebas psicológicas?La validez no es una propiedad que posea un test. Es un argumento sobre si una interpretación particular de una puntuación particular, para un propósito particular, es defendible — y debe reconstruirse para cada nuevo uso.
- ¿Qué es la validez de constructo?La pregunta más difícil en la medición: si aquello que estás midiendo existe tal como lo has definido, y si tu instrumento lo alcanza a él en lugar de algo adyacente.
- Validez convergente y discriminanteDos requisitos que son imagen especular el uno del otro: una medida debe coincidir con aquello con lo que debería coincidir, y debe mantenerse distinta de aquello de lo que afirma diferenciarse. La mayoría de los instrumentos débiles fallan en el segundo.
- Error estándar de medición: cuánto puede desviarse tu puntuaciónToda puntuación lleva un margen de error, y en la mayoría de los tests psicológicos es más amplio de lo que la gente supone. Este es el número que te indica cuándo una diferencia es real y cuándo es ruido.
- Normas y percentiles: con qué se compara tu puntuaciónUna puntuación bruta es ininterpretable por sí sola. Solo adquiere significado frente a un grupo de referencia, y qué grupo se utilizó es uno de los hechos más determinantes y menos divulgados de cualquier test.
- Cómo se construye realmente una prueba psicométricaDesde la definición del constructo hasta las normas publicadas, el proceso lleva años y descarta la mayor parte de lo que se invierte en él. Conocer las etapas hace evidente cuáles omitió un cuestionario rápido en línea.
- ¿Qué significa que un test sea llamado validado?La palabra no está regulada y es utilizada libremente por productos que no han hecho ninguno de los trabajos requeridos. Esto es lo que significa cuando realmente significa algo, y las cuatro preguntas que separan ambos casos.
- Por qué la mayoría de los tests de personalidad en internet no son fiablesNo porque sean deshonestos, sino porque los pasos que hacen que una medición sea confiable son invisibles, costosos y fáciles de omitir, y omitirlos no cambia en nada el aspecto del resultado.
- Lo que la autoinforme puede y no puede medirLos cuestionarios te piden que seas el observador de ti mismo, lo cual funciona mejor para algunas cosas que para otras. Saber dónde el método es sólido y dónde falla cambia la forma en que interpretas cualquier resultado.
- Qué significa cuando una prueba predice algoUna correlación de 0,30 es un hallazgo sólido en la investigación de la personalidad y una base débil para tomar una decisión sobre una persona concreta. Ambas afirmaciones son verdaderas, y la brecha entre ellas explica la mayoría de los usos incorrectos de los resultados de las pruebas.
- El cribado no es diagnósticoUn cuestionario de cribado está diseñado para detectar el mayor número posible de casos, aceptando una alta tasa de falsos positivos como precio. Interpretar una puntuación de cribado como un diagnóstico invierte aquello para lo que fue concebido.