¿Qué es la fiabilidad en las pruebas psicológicas?
La fiabilidad es la consistencia de la medición, no su exactitud. Una prueba puede ser muy fiable y aun así medir algo equivocado, razón por la cual es la primera pregunta que se formula y nunca la última.
La fiabilidad es el grado en que una medición es repetible en lugar de aleatoria. Si te pesaras tres veces en un minuto y obtuvieras 71, 78 y 66 kilogramos, la báscula sería poco fiable y no tendrías forma de conocer tu peso real a partir de ella. La medición psicológica enfrenta el mismo problema con instrumentos mucho menos precisos.
Lo fundamental que hay que entender sobre la fiabilidad es lo que no implica. Una báscula de baño que consistentemente marca ocho kilogramos de más es perfectamente fiable y completamente incorrecta. La fiabilidad tiene que ver con la consistencia; si el número mide lo que debe medir es una pregunta aparte, denominada validez. La fiabilidad es necesaria para la validez, pero está lejos de ser suficiente.
Las formas que adopta
La consistencia interna examina si los ítems de una escala concuerdan entre sí. Si se supone que diez preguntas miden el mismo rasgo subyacente, quienes respondan alto en una deberían tender a responder alto en las demás. Esto se suele reportar como alfa de Cronbach o, mejor aún, omega de McDonald.
La fiabilidad test-retest examina si la misma persona obtiene puntuaciones similares en dos ocasiones distintas. Es la forma más relevante para los rasgos, que por definición deben ser estables. También es la que con más frecuencia no se reporta, porque requiere localizar a los mismos participantes semanas después.
La fiabilidad interjueces se aplica cuando personas califican el instrumento, como en entrevistas clínicas, técnicas proyectivas u observación conductual. Examina si dos evaluadores entrenados que analizan el mismo material llegan a la misma conclusión.
La fiabilidad de formas paralelas examina si dos versiones distintas de la misma prueba, construidas para ser equivalentes, producen las mismas puntuaciones. Es relevante cuando una prueba se administra más de una vez y la exposición a los ítems es una preocupación.
Cómo interpretar los números
Los coeficientes de fiabilidad van de 0 a 1. Las convenciones son aproximadas y a menudo se usan incorrectamente, pero en términos generales: por encima de 0,90 se requiere cuando una puntuación afecta la vida de una persona; entre 0,80 y 0,90 es sólido para la mayoría de los usos aplicados; entre 0,70 y 0,80 es aceptable para la investigación y las comparaciones grupales; y por debajo de 0,70, la puntuación contiene más error del que la mayoría de las conclusiones pueden tolerar.
Dos advertencias sobre estos umbrales. Primero, son convenciones, no leyes: el nivel aceptable depende enteramente del uso que se dará a la puntuación. Segundo, un alfa muy alto en una escala breve suele indicar que los ítems son casi paráfrasis entre sí, lo que logra consistencia a costa de la cobertura del constructo. Una escala de diez preguntas que todas preguntan «¿eres organizado?» con palabras ligeramente distintas tendrá una consistencia interna excelente y una medición muy estrecha de la responsabilidad.
Lo que significa para tu propia puntuación
La fiabilidad se traduce directamente en el nivel de confianza que merece un número individual. Una prueba con una fiabilidad de 0,85 conlleva un error de medición suficientemente grande como para que una diferencia de unos pocos puntos entre dos personas, o entre tu puntuación de hoy y la del mes pasado, sea muy probablemente ruido en lugar de señal.
Esta es la consecuencia práctica: un buen instrumento informa su fiabilidad para que sepas cuán amplia es la incertidumbre alrededor de tu puntuación. La expresión técnica de esa incertidumbre es el error estándar de medición, que convierte un coeficiente de fiabilidad en un margen de más o menos alrededor de la puntuación.
Un instrumento que no reporta ningún índice de fiabilidad no es por ello más preciso. Simplemente ha optado por no decirte cuán impreciso es.
Ponlo a prueba
Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.
Sigue leyendo
- ¿Qué es la psicometría?La disciplina que determina si una medición psicológica es válida y confiable, y la razón por la que dos pruebas que formulan preguntas similares pueden diferir enormemente en el valor de sus resultados.
- ¿Qué es la validez en las pruebas psicológicas?La validez no es una propiedad que posea un test. Es un argumento sobre si una interpretación particular de una puntuación particular, para un propósito particular, es defendible — y debe reconstruirse para cada nuevo uso.
- ¿Qué es la validez de constructo?La pregunta más difícil en la medición: si aquello que estás midiendo existe tal como lo has definido, y si tu instrumento lo alcanza a él en lugar de algo adyacente.
- Validez convergente y discriminanteDos requisitos que son imagen especular el uno del otro: una medida debe coincidir con aquello con lo que debería coincidir, y debe mantenerse distinta de aquello de lo que afirma diferenciarse. La mayoría de los instrumentos débiles fallan en el segundo.
- Qué es el alfa de Cronbach y qué no esEl estadístico más reportado en la evaluación psicológica y el más malinterpretado. El alfa no indica que una escala sea unidimensional, y un valor alto suele ser un síntoma más que una virtud.
- Error estándar de medición: cuánto puede desviarse tu puntuaciónToda puntuación lleva un margen de error, y en la mayoría de los tests psicológicos es más amplio de lo que la gente supone. Este es el número que te indica cuándo una diferencia es real y cuándo es ruido.
- Normas y percentiles: con qué se compara tu puntuaciónUna puntuación bruta es ininterpretable por sí sola. Solo adquiere significado frente a un grupo de referencia, y qué grupo se utilizó es uno de los hechos más determinantes y menos divulgados de cualquier test.
- Cómo se construye realmente una prueba psicométricaDesde la definición del constructo hasta las normas publicadas, el proceso lleva años y descarta la mayor parte de lo que se invierte en él. Conocer las etapas hace evidente cuáles omitió un cuestionario rápido en línea.
- ¿Qué significa que un test sea llamado validado?La palabra no está regulada y es utilizada libremente por productos que no han hecho ninguno de los trabajos requeridos. Esto es lo que significa cuando realmente significa algo, y las cuatro preguntas que separan ambos casos.
- Por qué la mayoría de los tests de personalidad en internet no son fiablesNo porque sean deshonestos, sino porque los pasos que hacen que una medición sea confiable son invisibles, costosos y fáciles de omitir, y omitirlos no cambia en nada el aspecto del resultado.
- Lo que la autoinforme puede y no puede medirLos cuestionarios te piden que seas el observador de ti mismo, lo cual funciona mejor para algunas cosas que para otras. Saber dónde el método es sólido y dónde falla cambia la forma en que interpretas cualquier resultado.
- Qué significa cuando una prueba predice algoUna correlación de 0,30 es un hallazgo sólido en la investigación de la personalidad y una base débil para tomar una decisión sobre una persona concreta. Ambas afirmaciones son verdaderas, y la brecha entre ellas explica la mayoría de los usos incorrectos de los resultados de las pruebas.
- El cribado no es diagnósticoUn cuestionario de cribado está diseñado para detectar el mayor número posible de casos, aceptando una alta tasa de falsos positivos como precio. Interpretar una puntuación de cribado como un diagnóstico invierte aquello para lo que fue concebido.