Cómo se construye realmente una prueba psicométrica
Desde la definición del constructo hasta las normas publicadas, el proceso lleva años y descarta la mayor parte de lo que se invierte en él. Conocer las etapas hace evidente cuáles omitió un cuestionario rápido en línea.
Un instrumento psicométrico que llega a publicarse ha pasado generalmente por cinco o seis años de trabajo y ha descartado la mayor parte de lo que se escribió para él. Vale la pena conocer el proceso, porque cada etapa corresponde a una forma en que una prueba puede ser inadecuada.
1. Definir el constructo
Antes de redactar cualquier ítem, el constructo debe especificarse con suficiente precisión para establecer qué queda fuera de él. Esto implica una definición, una descripción de la estructura dimensional —una dimensión o varias, y si son varias, cómo se relacionan— y una explicación explícita de qué constructos vecinos se pretende que sea distinto.
Omitir esta etapa es el origen de la mayoría de los instrumentos redundantes. Una escala construida a partir de una noción intuitiva de un concepto suele terminar midiendo un rasgo ya establecido bajo un nombre nuevo.
2. Generar un banco de ítems
Los ítems se redactan en número muy superior al que sobrevivirá —típicamente entre tres y cinco veces la cantidad final. Provienen de la teoría, de instrumentos existentes, de entrevistas con personas que tienen la experiencia que se describe y de expertos en la materia.
En esta etapa, el banco se revisa para verificar la cobertura del contenido (¿abarca todo el constructo o se concentra en una sola faceta?), el nivel de lectura, la formulación ambigua y los ítems que en realidad preguntan sobre otra cosa.
3. Pilotaje y depuración
El banco se aplica a una primera muestra. El análisis es principalmente destructivo.
Se eliminan los ítems con casi ninguna varianza —una pregunta que todos responden igual no distingue a nadie. Se eliminan los ítems que correlacionan poco con la puntuación total. Se eliminan los ítems que saturan en más de un factor. Se eliminan los ítems que se comportan de manera diferente entre grupos demográficos por razones ajenas al rasgo —funcionamiento diferencial del ítem—, y esta verificación es una de las que se omite con mayor frecuencia.
Lo que sobrevive es típicamente un tercio de lo que se escribió.
4. Confirmar la estructura en una muestra nueva
Este es el paso que separa los instrumentos serios del resto. El análisis factorial sobre la muestra de desarrollo recuperará la estructura que fue diseñada —es inevitable, ya que los ítems fueron seleccionados para producirla. La verdadera prueba es el análisis factorial confirmatorio en una muestra independiente.
Muchas escalas publicadas recuperan su estructura prevista únicamente en los datos utilizados para construirlas. Cuando otra persona recopila datos nuevos, los factores no aparecen. Este fallo es lo suficientemente común como para que «¿fue confirmada la estructura en una muestra independiente?» sea una de las preguntas más eficientes que se pueden hacer sobre cualquier instrumento.
5. Acumular evidencia de validez
Correlaciones con medidas establecidas del mismo constructo. Correlaciones con constructos de los que debería diferenciarse, que deberían ser más bajas. Relaciones con resultados relevantes. Validez incremental sobre lo que ya existe. Estabilidad test-retest en un intervalo apropiado para el constructo.
Esta etapa no concluye. Continúa mientras el instrumento está en uso, y es donde con mayor frecuencia se detectan deficiencias años después de la publicación.
6. Construir normas
Una muestra de referencia suficientemente grande y representativa para la población prevista, estratificada cuando el rasgo varía según edad o sexo, documentada en cuanto a año y país. Luego repetida periódicamente, porque las normas cambian con el tiempo.
7. Traducir, si se usará en otro contexto
La traducción no es un ejercicio lingüístico. Una adaptación adecuada implica traducción directa, retrotraducción independiente, revisión por expertos, entrevistas cognitivas con hablantes de la lengua de destino y, posteriormente, un estudio psicométrico nuevo en el idioma de destino para comprobar si la estructura se mantiene y si los ítems funcionan de manera equivalente. Un instrumento traducido sin ese estudio es un instrumento no validado en ese idioma, independientemente de sus credenciales en el original.
Lo que esto implica sobre el cuestionario rápido
Una prueba redactada en una tarde ha completado el paso dos. Es muy probable que produzca un resultado de apariencia plausible: un percentil y un párrafo descriptivo. Los pasos que omitió son precisamente los que habrían establecido si todo eso significa algo.
Ponlo a prueba
Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.
Sigue leyendo
- ¿Qué es la psicometría?La disciplina que determina si una medición psicológica es válida y confiable, y la razón por la que dos pruebas que formulan preguntas similares pueden diferir enormemente en el valor de sus resultados.
- ¿Qué es la fiabilidad en las pruebas psicológicas?La fiabilidad es la consistencia de la medición, no su exactitud. Una prueba puede ser muy fiable y aun así medir algo equivocado, razón por la cual es la primera pregunta que se formula y nunca la última.
- ¿Qué es la validez en las pruebas psicológicas?La validez no es una propiedad que posea un test. Es un argumento sobre si una interpretación particular de una puntuación particular, para un propósito particular, es defendible — y debe reconstruirse para cada nuevo uso.
- ¿Qué es la validez de constructo?La pregunta más difícil en la medición: si aquello que estás midiendo existe tal como lo has definido, y si tu instrumento lo alcanza a él en lugar de algo adyacente.
- Validez convergente y discriminanteDos requisitos que son imagen especular el uno del otro: una medida debe coincidir con aquello con lo que debería coincidir, y debe mantenerse distinta de aquello de lo que afirma diferenciarse. La mayoría de los instrumentos débiles fallan en el segundo.
- Qué es el alfa de Cronbach y qué no esEl estadístico más reportado en la evaluación psicológica y el más malinterpretado. El alfa no indica que una escala sea unidimensional, y un valor alto suele ser un síntoma más que una virtud.
- Error estándar de medición: cuánto puede desviarse tu puntuaciónToda puntuación lleva un margen de error, y en la mayoría de los tests psicológicos es más amplio de lo que la gente supone. Este es el número que te indica cuándo una diferencia es real y cuándo es ruido.
- Normas y percentiles: con qué se compara tu puntuaciónUna puntuación bruta es ininterpretable por sí sola. Solo adquiere significado frente a un grupo de referencia, y qué grupo se utilizó es uno de los hechos más determinantes y menos divulgados de cualquier test.
- ¿Qué significa que un test sea llamado validado?La palabra no está regulada y es utilizada libremente por productos que no han hecho ninguno de los trabajos requeridos. Esto es lo que significa cuando realmente significa algo, y las cuatro preguntas que separan ambos casos.
- Por qué la mayoría de los tests de personalidad en internet no son fiablesNo porque sean deshonestos, sino porque los pasos que hacen que una medición sea confiable son invisibles, costosos y fáciles de omitir, y omitirlos no cambia en nada el aspecto del resultado.
- Lo que la autoinforme puede y no puede medirLos cuestionarios te piden que seas el observador de ti mismo, lo cual funciona mejor para algunas cosas que para otras. Saber dónde el método es sólido y dónde falla cambia la forma en que interpretas cualquier resultado.
- Qué significa cuando una prueba predice algoUna correlación de 0,30 es un hallazgo sólido en la investigación de la personalidad y una base débil para tomar una decisión sobre una persona concreta. Ambas afirmaciones son verdaderas, y la brecha entre ellas explica la mayoría de los usos incorrectos de los resultados de las pruebas.
- El cribado no es diagnósticoUn cuestionario de cribado está diseñado para detectar el mayor número posible de casos, aceptando una alta tasa de falsos positivos como precio. Interpretar una puntuación de cribado como un diagnóstico invierte aquello para lo que fue concebido.