¿Qué es la validez en las pruebas psicológicas?
La validez no es una propiedad que posea un test. Es un argumento sobre si una interpretación particular de una puntuación particular, para un propósito particular, es defendible — y debe reconstruirse para cada nuevo uso.
La validez pregunta si un test mide lo que afirma medir y si las conclusiones que las personas extraen de sus puntuaciones están justificadas. Es la pregunta central en psicometría y la que con mayor frecuencia se responde con afirmaciones de marketing en lugar de evidencia.
La comprensión moderna, vigente desde los trabajos de Messick en la década de 1980, sostiene que la validez no es un atributo fijo de un instrumento. Es una propiedad de una interpretación de las puntuaciones para un uso específico. El mismo cuestionario puede estar bien validado para describir la autopercepción de una persona y carecer completamente de validación para decidir si contratarla. Decir «este test es válido» sin especificar válido para qué no es una afirmación; es un eslogan.
Tipos de evidencia
La validez se construye a partir de evidencia acumulada de varios tipos. Los textos más antiguos presentan estos tipos como especies separadas de validez; la perspectiva actual los trata como argumentos distintos que sostienen un caso único.
La evidencia de contenido pregunta si los ítems cubren el constructo adecuadamente. Una escala de depresión que solo pregunta sobre el sueño y el apetito cubre los síntomas somáticos y omite los síntomas de estado de ánimo y cognitivos. La cobertura de contenido suele ser evaluada por expertos en la materia, y es la razón por la que las escalas muy breves siempre implican un compromiso.
La evidencia de estructura interna pregunta si los ítems se agrupan de la manera que la teoría predice. Si un modelo postula cuatro facetas diferenciadas, el análisis factorial debería recuperar cuatro factores — y de manera crucial, en una muestra independiente, no solo en aquella con la que se construyó la escala. Muchos instrumentos recuperan su estructura prevista en la muestra de desarrollo y fracasan al hacerlo en muestras de otros investigadores.
Las relaciones con otras variables es donde se concentra la mayor parte del trabajo. La evidencia convergente muestra que la escala correlaciona con aquello con lo que debería correlacionar. La evidencia discriminante muestra que no correlaciona demasiado con aquello de lo que debería diferenciarse — un requisito crónicamente descuidado y el que socava muchos constructos recién etiquetados. La evidencia de criterio muestra que la puntuación se relaciona con un resultado relevante, ya sea medido simultáneamente o predicho con antelación.
La evidencia consecuencial pregunta qué ocurre cuando se utiliza el test. Si un instrumento perjudica sistemáticamente a un grupo por razones no relacionadas con el constructo, se trata de un problema de validez, no meramente ético.
La pregunta que desmonta la mayoría de las afirmaciones
La prueba más rigurosa de una afirmación de validez es la validez incremental: ¿aporta este instrumento algo más allá de lo que ya ofrece una medida más económica, antigua y consolidada?
Un número notable de constructos con marca comercial fracasan en este punto. Correlacionan 0,7 o más con un dominio existente del modelo de los Cinco Grandes, predicen los mismos resultados con la misma magnitud y no añaden nada una vez que se controla estadísticamente la medida más antigua. El constructo es nuevo; la medición no lo es. Por eso las secciones de críticas en la documentación seria de instrumentos se centran tan frecuentemente en la redundancia más que en la inexactitud.
Qué buscar
Cuando alguien afirma que un test está validado, las preguntas útiles son concretas. ¿Validado frente a qué criterio? ¿En qué población y de qué tamaño? ¿Se confirmó la estructura factorial en una muestra independiente? ¿Existe evidencia publicada por investigadores sin interés comercial en la respuesta? ¿Aporta algo más allá de una alternativa consolidada?
Un instrumento con respuestas honestas a esas preguntas merece tomarse en serio, limitaciones incluidas. Un instrumento cuya validación consiste en una página de testimonios y la afirmación de que millones de personas lo han realizado ha respondido a una pregunta completamente distinta — la popularidad no es evidencia, y el número de personas que han realizado un test no dice nada sobre si sus puntuaciones significan algo.
Ponlo a prueba
Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.
Sigue leyendo
- ¿Qué es la psicometría?La disciplina que determina si una medición psicológica es válida y confiable, y la razón por la que dos pruebas que formulan preguntas similares pueden diferir enormemente en el valor de sus resultados.
- ¿Qué es la fiabilidad en las pruebas psicológicas?La fiabilidad es la consistencia de la medición, no su exactitud. Una prueba puede ser muy fiable y aun así medir algo equivocado, razón por la cual es la primera pregunta que se formula y nunca la última.
- ¿Qué es la validez de constructo?La pregunta más difícil en la medición: si aquello que estás midiendo existe tal como lo has definido, y si tu instrumento lo alcanza a él en lugar de algo adyacente.
- Validez convergente y discriminanteDos requisitos que son imagen especular el uno del otro: una medida debe coincidir con aquello con lo que debería coincidir, y debe mantenerse distinta de aquello de lo que afirma diferenciarse. La mayoría de los instrumentos débiles fallan en el segundo.
- Qué es el alfa de Cronbach y qué no esEl estadístico más reportado en la evaluación psicológica y el más malinterpretado. El alfa no indica que una escala sea unidimensional, y un valor alto suele ser un síntoma más que una virtud.
- Error estándar de medición: cuánto puede desviarse tu puntuaciónToda puntuación lleva un margen de error, y en la mayoría de los tests psicológicos es más amplio de lo que la gente supone. Este es el número que te indica cuándo una diferencia es real y cuándo es ruido.
- Normas y percentiles: con qué se compara tu puntuaciónUna puntuación bruta es ininterpretable por sí sola. Solo adquiere significado frente a un grupo de referencia, y qué grupo se utilizó es uno de los hechos más determinantes y menos divulgados de cualquier test.
- Cómo se construye realmente una prueba psicométricaDesde la definición del constructo hasta las normas publicadas, el proceso lleva años y descarta la mayor parte de lo que se invierte en él. Conocer las etapas hace evidente cuáles omitió un cuestionario rápido en línea.
- ¿Qué significa que un test sea llamado validado?La palabra no está regulada y es utilizada libremente por productos que no han hecho ninguno de los trabajos requeridos. Esto es lo que significa cuando realmente significa algo, y las cuatro preguntas que separan ambos casos.
- Por qué la mayoría de los tests de personalidad en internet no son fiablesNo porque sean deshonestos, sino porque los pasos que hacen que una medición sea confiable son invisibles, costosos y fáciles de omitir, y omitirlos no cambia en nada el aspecto del resultado.
- Lo que la autoinforme puede y no puede medirLos cuestionarios te piden que seas el observador de ti mismo, lo cual funciona mejor para algunas cosas que para otras. Saber dónde el método es sólido y dónde falla cambia la forma en que interpretas cualquier resultado.
- Qué significa cuando una prueba predice algoUna correlación de 0,30 es un hallazgo sólido en la investigación de la personalidad y una base débil para tomar una decisión sobre una persona concreta. Ambas afirmaciones son verdaderas, y la brecha entre ellas explica la mayoría de los usos incorrectos de los resultados de las pruebas.
- El cribado no es diagnósticoUn cuestionario de cribado está diseñado para detectar el mayor número posible de casos, aceptando una alta tasa de falsos positivos como precio. Interpretar una puntuación de cribado como un diagnóstico invierte aquello para lo que fue concebido.