noesisnoesis
Cómo se mide

¿Qué es la validez en las pruebas psicológicas?

La validez no es una propiedad que posea un test. Es un argumento sobre si una interpretación particular de una puntuación particular, para un propósito particular, es defendible — y debe reconstruirse para cada nuevo uso.

La validez pregunta si un test mide lo que afirma medir y si las conclusiones que las personas extraen de sus puntuaciones están justificadas. Es la pregunta central en psicometría y la que con mayor frecuencia se responde con afirmaciones de marketing en lugar de evidencia.

La comprensión moderna, vigente desde los trabajos de Messick en la década de 1980, sostiene que la validez no es un atributo fijo de un instrumento. Es una propiedad de una interpretación de las puntuaciones para un uso específico. El mismo cuestionario puede estar bien validado para describir la autopercepción de una persona y carecer completamente de validación para decidir si contratarla. Decir «este test es válido» sin especificar válido para qué no es una afirmación; es un eslogan.

Tipos de evidencia

La validez se construye a partir de evidencia acumulada de varios tipos. Los textos más antiguos presentan estos tipos como especies separadas de validez; la perspectiva actual los trata como argumentos distintos que sostienen un caso único.

La evidencia de contenido pregunta si los ítems cubren el constructo adecuadamente. Una escala de depresión que solo pregunta sobre el sueño y el apetito cubre los síntomas somáticos y omite los síntomas de estado de ánimo y cognitivos. La cobertura de contenido suele ser evaluada por expertos en la materia, y es la razón por la que las escalas muy breves siempre implican un compromiso.

La evidencia de estructura interna pregunta si los ítems se agrupan de la manera que la teoría predice. Si un modelo postula cuatro facetas diferenciadas, el análisis factorial debería recuperar cuatro factores — y de manera crucial, en una muestra independiente, no solo en aquella con la que se construyó la escala. Muchos instrumentos recuperan su estructura prevista en la muestra de desarrollo y fracasan al hacerlo en muestras de otros investigadores.

Las relaciones con otras variables es donde se concentra la mayor parte del trabajo. La evidencia convergente muestra que la escala correlaciona con aquello con lo que debería correlacionar. La evidencia discriminante muestra que no correlaciona demasiado con aquello de lo que debería diferenciarse — un requisito crónicamente descuidado y el que socava muchos constructos recién etiquetados. La evidencia de criterio muestra que la puntuación se relaciona con un resultado relevante, ya sea medido simultáneamente o predicho con antelación.

La evidencia consecuencial pregunta qué ocurre cuando se utiliza el test. Si un instrumento perjudica sistemáticamente a un grupo por razones no relacionadas con el constructo, se trata de un problema de validez, no meramente ético.

La pregunta que desmonta la mayoría de las afirmaciones

La prueba más rigurosa de una afirmación de validez es la validez incremental: ¿aporta este instrumento algo más allá de lo que ya ofrece una medida más económica, antigua y consolidada?

Un número notable de constructos con marca comercial fracasan en este punto. Correlacionan 0,7 o más con un dominio existente del modelo de los Cinco Grandes, predicen los mismos resultados con la misma magnitud y no añaden nada una vez que se controla estadísticamente la medida más antigua. El constructo es nuevo; la medición no lo es. Por eso las secciones de críticas en la documentación seria de instrumentos se centran tan frecuentemente en la redundancia más que en la inexactitud.

Qué buscar

Cuando alguien afirma que un test está validado, las preguntas útiles son concretas. ¿Validado frente a qué criterio? ¿En qué población y de qué tamaño? ¿Se confirmó la estructura factorial en una muestra independiente? ¿Existe evidencia publicada por investigadores sin interés comercial en la respuesta? ¿Aporta algo más allá de una alternativa consolidada?

Un instrumento con respuestas honestas a esas preguntas merece tomarse en serio, limitaciones incluidas. Un instrumento cuya validación consiste en una página de testimonios y la afirmación de que millones de personas lo han realizado ha respondido a una pregunta completamente distinta — la popularidad no es evidencia, y el número de personas que han realizado un test no dice nada sobre si sus puntuaciones significan algo.

Ponlo a prueba

Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.

Sigue leyendo