Validez convergente y discriminante
Dos requisitos que son imagen especular el uno del otro: una medida debe coincidir con aquello con lo que debería coincidir, y debe mantenerse distinta de aquello de lo que afirma diferenciarse. La mayoría de los instrumentos débiles fallan en el segundo.
La validez convergente y discriminante son las dos mitades de un único requisito. Una medida debe correlacionar con aquello con lo que teóricamente debería hacerlo, y no debe correlacionar demasiado con aquello de lo que se supone que es distinta. Cumplir uno sin el otro no es un éxito parcial; generalmente es una señal de que el constructo no es lo que dice ser.
Validez convergente
La evidencia convergente muestra que una medida está alineada con otros indicadores del mismo fenómeno. Una nueva escala de ansiedad debería correlacionar de forma sustancial con escalas de ansiedad establecidas, con valoraciones clínicas y, idealmente, con algo que no sea otro cuestionario, como medidas fisiológicas o conductas de evitación observadas.
En este caso, se espera que las correlaciones superen generalmente 0,50, y con frecuencia 0,70 cuando la medida de comparación es un instrumento bien establecido para el mismo constructo. Por debajo de ese umbral, o la nueva escala o la de comparación está midiendo otra cosa.
Existe una trampa. Una correlación de 0,95 con una escala existente no es un triunfo: significa que el nuevo instrumento es un reempaquetado, y la pregunta honesta pasa a ser qué aporta. La validez convergente es un umbral mínimo, no un objetivo a maximizar.
Validez discriminante
La evidencia discriminante muestra que la medida se mantiene separada de los constructos de los que afirma diferir. Aquí es donde viven los fracasos más interesantes.
El patrón se repite a lo largo de la literatura. La perseverancia correlaciona alrededor de 0,84 con la responsabilidad, lo suficientemente cerca como para que un metaanálisis concluyera que no añade prácticamente nada a la predicción académica una vez que se controla la responsabilidad. La inteligencia emocional autoinformada se superpone ampliamente con la estabilidad emocional, la extraversión y la responsabilidad combinadas. La varianza compartida en la Tríada Oscura desaparece en gran medida una vez que se tiene en cuenta la Honestidad-Humildad del modelo HEXACO. En cada caso, el constructo se presentó como territorio nuevo y resultó ser una región renombrada de un mapa ya existente.
La validez discriminante es también donde afloran los efectos de método. Si todos los constructos autoinformados en un estudio correlacionan 0,4 entre sí, el factor común probablemente sea el estilo de respuesta del encuestado y no ninguna psicología compartida.
La prueba definitiva
El procedimiento decisivo es la validez incremental: introducir primero la medida establecida en una regresión, luego la nueva, y comprobar si esta última explica varianza adicional en el criterio. Si no lo hace, el constructo puede seguir siendo teóricamente interesante, pero el instrumento no está midiendo nada que el campo no tuviera ya.
Este es un estándar exigente, y muchas escalas publicadas nunca han sido sometidas a él. Cuando lo son, el resultado suele ser el hallazgo de redundancia mencionado anteriormente. Eso no es un escándalo —es una poda científica normal—, pero sí significa que la popularidad de un constructo no informa en absoluto sobre si supera la prueba.
Lo que cambia para quien lee
Cuando una prueba reporta varias puntuaciones, la pregunta útil es si esas puntuaciones son realmente distintas. Cuatro dimensiones que correlacionan 0,8 entre sí son una sola dimensión con cuatro etiquetas, y un perfil construido a partir de ellas parecerá diferenciado mientras contiene casi ninguna información independiente.
Los instrumentos que reportan sus correlaciones inter-escala permiten verificar esto de forma personal. Los que presentan una tipología de cuatro cuadrantes sin mostrar jamás cómo se relacionan entre sí han hecho imposible esa verificación, lo cual suele ser precisamente la intención.
Ponlo a prueba
Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.
Sigue leyendo
- ¿Qué es la psicometría?La disciplina que determina si una medición psicológica es válida y confiable, y la razón por la que dos pruebas que formulan preguntas similares pueden diferir enormemente en el valor de sus resultados.
- ¿Qué es la fiabilidad en las pruebas psicológicas?La fiabilidad es la consistencia de la medición, no su exactitud. Una prueba puede ser muy fiable y aun así medir algo equivocado, razón por la cual es la primera pregunta que se formula y nunca la última.
- ¿Qué es la validez en las pruebas psicológicas?La validez no es una propiedad que posea un test. Es un argumento sobre si una interpretación particular de una puntuación particular, para un propósito particular, es defendible — y debe reconstruirse para cada nuevo uso.
- ¿Qué es la validez de constructo?La pregunta más difícil en la medición: si aquello que estás midiendo existe tal como lo has definido, y si tu instrumento lo alcanza a él en lugar de algo adyacente.
- Qué es el alfa de Cronbach y qué no esEl estadístico más reportado en la evaluación psicológica y el más malinterpretado. El alfa no indica que una escala sea unidimensional, y un valor alto suele ser un síntoma más que una virtud.
- Error estándar de medición: cuánto puede desviarse tu puntuaciónToda puntuación lleva un margen de error, y en la mayoría de los tests psicológicos es más amplio de lo que la gente supone. Este es el número que te indica cuándo una diferencia es real y cuándo es ruido.
- Normas y percentiles: con qué se compara tu puntuaciónUna puntuación bruta es ininterpretable por sí sola. Solo adquiere significado frente a un grupo de referencia, y qué grupo se utilizó es uno de los hechos más determinantes y menos divulgados de cualquier test.
- Cómo se construye realmente una prueba psicométricaDesde la definición del constructo hasta las normas publicadas, el proceso lleva años y descarta la mayor parte de lo que se invierte en él. Conocer las etapas hace evidente cuáles omitió un cuestionario rápido en línea.
- ¿Qué significa que un test sea llamado validado?La palabra no está regulada y es utilizada libremente por productos que no han hecho ninguno de los trabajos requeridos. Esto es lo que significa cuando realmente significa algo, y las cuatro preguntas que separan ambos casos.
- Por qué la mayoría de los tests de personalidad en internet no son fiablesNo porque sean deshonestos, sino porque los pasos que hacen que una medición sea confiable son invisibles, costosos y fáciles de omitir, y omitirlos no cambia en nada el aspecto del resultado.
- Lo que la autoinforme puede y no puede medirLos cuestionarios te piden que seas el observador de ti mismo, lo cual funciona mejor para algunas cosas que para otras. Saber dónde el método es sólido y dónde falla cambia la forma en que interpretas cualquier resultado.
- Qué significa cuando una prueba predice algoUna correlación de 0,30 es un hallazgo sólido en la investigación de la personalidad y una base débil para tomar una decisión sobre una persona concreta. Ambas afirmaciones son verdaderas, y la brecha entre ellas explica la mayoría de los usos incorrectos de los resultados de las pruebas.
- El cribado no es diagnósticoUn cuestionario de cribado está diseñado para detectar el mayor número posible de casos, aceptando una alta tasa de falsos positivos como precio. Interpretar una puntuación de cribado como un diagnóstico invierte aquello para lo que fue concebido.