¿Qué es la psicometría?
La disciplina que determina si una medición psicológica es válida y confiable, y la razón por la que dos pruebas que formulan preguntas similares pueden diferir enormemente en el valor de sus resultados.
La psicometría es la rama de la psicología que se ocupa de la medición en sí misma. No de lo que significa la extraversión, sino de si un conjunto determinado de preguntas la mide realmente, cuánto error contiene el número resultante y qué puede predecir legítimamente ese número.
La distinción importa más de lo que parece. Cualquiera puede escribir veinte preguntas sobre cuán sociable es alguien y sumar las respuestas. La psicometría es el trabajo que viene después: demostrar que las veinte preguntas forman un conjunto coherente, que miden una sola cosa en lugar de tres, que la misma persona obtiene aproximadamente la misma puntuación el mes siguiente, que la puntuación se relaciona con el comportamiento real de esa persona, y que todo el sistema funciona de la misma manera para un joven de 22 años en Lisboa que para una persona de 55 años en Múnich.
Por qué era necesaria esta disciplina
La medición física tiene una ventaja que la psicología no posee: es posible colocar una regla junto a lo que se está midiendo. No existe ninguna regla para medir la responsabilidad. El rasgo no es directamente observable — se infiere a partir del comportamiento, y las respuestas a los cuestionarios son una capa adicional de inferencia sobre eso.
Esto es lo que los psicometristas denominan una variable latente: algo suficientemente real como para tener consecuencias, pero que solo es accesible a través de indicadores indirectos. Todo el aparato metodológico existe precisamente a causa de esa indirección. Cada técnica que se encontrará — análisis factorial, coeficientes de fiabilidad, teoría de respuesta al ítem, muestras normativas — es un intento de afirmar algo defendible sobre una cantidad que nadie puede observar.
Las tres preguntas
Prescindiendo del vocabulario técnico, la psicometría le plantea tres preguntas a cualquier instrumento.
¿Es consistente? Si la medición es principalmente ruido, nada más importa. La consistencia se verifica entre ítems (¿coinciden las preguntas entre sí?), a lo largo del tiempo (¿obtiene la misma persona la misma puntuación el mes siguiente?) y entre evaluadores cuando corresponde. Esto es la fiabilidad.
¿Mide lo que afirma medir? Un cuestionario puede ser perfectamente consistente y aun así medir la cosa equivocada. Una escala que afirma medir el potencial de liderazgo pero que correlaciona 0,8 con la autoestima simple está midiendo la autoestima. Esto es la validez, y no es una propiedad que un instrumento tiene o no tiene — es un argumento construido a partir de evidencia acumulada.
¿En comparación con quién? Una puntuación bruta de 34 no significa nada por sí sola. Solo se vuelve interpretable en relación con un grupo de referencia: 34 es elevado respecto a qué población, medida cuándo y dónde. Este es el trabajo de las normas, y es el paso que la mayoría de las pruebas de consumo omite por completo.
Cómo es una buena práctica
Un instrumento bien construido tiene un historial documentado. Alguien publicó cómo se redactaron los ítems y cuáles fueron descartados. Alguien reportó los coeficientes de fiabilidad, en muestras identificadas, con sus tamaños. Alguien verificó que la estructura factorial se mantuviera en una segunda muestra independiente, distinta de la utilizada para construir el instrumento. Alguien comprobó si los ítems funcionan de la misma manera en distintos idiomas y grupos etarios. Otra persona — idealmente sin ningún interés en el instrumento — intentó replicar los hallazgos y reportó los resultados.
Nada de esto hace que una prueba sea infalible. Hace que sus limitaciones sean conocibles, lo cual es una propiedad diferente y más útil. Un instrumento cuyo error de medición está documentado le indica cuánto confiar en una pequeña diferencia entre dos puntuaciones. Un instrumento sin estimación de error publicada no es más preciso; simplemente es más discreto respecto a su imprecisión.
Lo que esto implica para el lector
La psicometría no le dirá que una prueba es verdadera. Le dirá hasta qué punto puede utilizarse una puntuación antes de que deje de significar algo — qué preguntas puede responder, en qué poblaciones fue calibrada y qué tan grande debe ser una diferencia para que valga la pena considerarla.
Esa es una promesa más modesta que la que ofrecen la mayoría de los productos de personalidad. También es la única promesa que resiste el contacto con la evidencia.
Ponlo a prueba
Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.
Sigue leyendo
- ¿Qué es la fiabilidad en las pruebas psicológicas?La fiabilidad es la consistencia de la medición, no su exactitud. Una prueba puede ser muy fiable y aun así medir algo equivocado, razón por la cual es la primera pregunta que se formula y nunca la última.
- ¿Qué es la validez en las pruebas psicológicas?La validez no es una propiedad que posea un test. Es un argumento sobre si una interpretación particular de una puntuación particular, para un propósito particular, es defendible — y debe reconstruirse para cada nuevo uso.
- ¿Qué es la validez de constructo?La pregunta más difícil en la medición: si aquello que estás midiendo existe tal como lo has definido, y si tu instrumento lo alcanza a él en lugar de algo adyacente.
- Validez convergente y discriminanteDos requisitos que son imagen especular el uno del otro: una medida debe coincidir con aquello con lo que debería coincidir, y debe mantenerse distinta de aquello de lo que afirma diferenciarse. La mayoría de los instrumentos débiles fallan en el segundo.
- Qué es el alfa de Cronbach y qué no esEl estadístico más reportado en la evaluación psicológica y el más malinterpretado. El alfa no indica que una escala sea unidimensional, y un valor alto suele ser un síntoma más que una virtud.
- Error estándar de medición: cuánto puede desviarse tu puntuaciónToda puntuación lleva un margen de error, y en la mayoría de los tests psicológicos es más amplio de lo que la gente supone. Este es el número que te indica cuándo una diferencia es real y cuándo es ruido.
- Normas y percentiles: con qué se compara tu puntuaciónUna puntuación bruta es ininterpretable por sí sola. Solo adquiere significado frente a un grupo de referencia, y qué grupo se utilizó es uno de los hechos más determinantes y menos divulgados de cualquier test.
- Cómo se construye realmente una prueba psicométricaDesde la definición del constructo hasta las normas publicadas, el proceso lleva años y descarta la mayor parte de lo que se invierte en él. Conocer las etapas hace evidente cuáles omitió un cuestionario rápido en línea.
- ¿Qué significa que un test sea llamado validado?La palabra no está regulada y es utilizada libremente por productos que no han hecho ninguno de los trabajos requeridos. Esto es lo que significa cuando realmente significa algo, y las cuatro preguntas que separan ambos casos.
- Por qué la mayoría de los tests de personalidad en internet no son fiablesNo porque sean deshonestos, sino porque los pasos que hacen que una medición sea confiable son invisibles, costosos y fáciles de omitir, y omitirlos no cambia en nada el aspecto del resultado.
- Lo que la autoinforme puede y no puede medirLos cuestionarios te piden que seas el observador de ti mismo, lo cual funciona mejor para algunas cosas que para otras. Saber dónde el método es sólido y dónde falla cambia la forma en que interpretas cualquier resultado.
- Qué significa cuando una prueba predice algoUna correlación de 0,30 es un hallazgo sólido en la investigación de la personalidad y una base débil para tomar una decisión sobre una persona concreta. Ambas afirmaciones son verdaderas, y la brecha entre ellas explica la mayoría de los usos incorrectos de los resultados de las pruebas.
- El cribado no es diagnósticoUn cuestionario de cribado está diseñado para detectar el mayor número posible de casos, aceptando una alta tasa de falsos positivos como precio. Interpretar una puntuación de cribado como un diagnóstico invierte aquello para lo que fue concebido.