Error estándar de medición: cuánto puede desviarse tu puntuación
Toda puntuación lleva un margen de error, y en la mayoría de los tests psicológicos es más amplio de lo que la gente supone. Este es el número que te indica cuándo una diferencia es real y cuándo es ruido.
El error estándar de medición convierte un coeficiente de fiabilidad abstracto en algo concreto: una banda de más o menos alrededor de una puntuación. Responde a la pregunta que la mayoría de las pantallas de resultados dejan sin responder: ¿cuánto podría haber variado este número si hubiera hecho el test en otra tarde?
La fórmula es sencilla. Multiplica la desviación típica de la escala por la raíz cuadrada de uno menos su fiabilidad. Para una escala con una desviación típica de 10 y una fiabilidad de 0,85, el error estándar es de aproximadamente 3,9 puntos.
Lo que esa banda cubre realmente
Aproximadamente dos tercios de las veces, la posición verdadera de una persona se encuentra dentro de un error estándar de su puntuación observada. Para tener una confianza de aproximadamente el 95 por ciento, se necesitan aproximadamente dos errores estándar a cada lado.
Tomemos el ejemplo anterior. Alguien obtiene una puntuación de 62. El intervalo del 95 por ciento va desde aproximadamente 54 hasta 70. Eso es una ventana de dieciséis puntos en una escala donde la diferencia típica entre la media y claramente por encima de la media podría ser de diez puntos.
Esto no es un defecto de ese test en particular. Una fiabilidad de 0,85 es respetable. Es la precisión normal de la medición psicológica, y es la razón por la que los informes rigurosos presentan bandas en lugar de puntos.
Las consecuencias que la gente pasa por alto
Las pequeñas diferencias entre escalas suelen carecer de significado. Si tu extraversión es 58 y tu apertura es 54, la lectura honesta es que son indistinguibles. Las interpretaciones de perfil que construyen una narrativa a partir de diferencias de cuatro puntos están leyendo ruido.
Los pequeños cambios a lo largo del tiempo también suelen carecer de significado. Repetir un test y subir cinco puntos está dentro del error para la mayoría de los instrumentos. El cambio real de un rasgo ocurre a lo largo de años y se manifiesta como un movimiento claramente fuera de la banda de error, no como unos pocos puntos de mes a mes.
Los ordenamientos por rango amplifican el problema. Una diferencia de unos pocos puntos brutos puede mover a alguien diez posiciones percentilares en la zona central densa de una distribución, porque ahí es donde se sitúa la mayoría de las personas. Los rangos percentilares parecen precisos y son la forma menos estable de expresar una puntuación.
La precisión no es uniforme a lo largo de la escala. La teoría clásica de los tests asume un único valor de error para cada puntuación, lo cual es una simplificación. La teoría de respuesta al ítem modela el error por separado en cada nivel del rasgo, y casi siempre es mayor en los extremos, precisamente donde se realizan las interpretaciones más trascendentes. Una puntuación muy alta o muy baja suele ser menos precisa que una intermedia, no más.
Por qué los informes honestos parecen menos impresionantes
Un instrumento que presenta bandas de confianza parece más impreciso que uno que reporta un único número con un decimal. El que parece más impreciso está diciendo la verdad. El que parece preciso tiene el mismo error subyacente y ha elegido no mostrarlo.
Esto vale la pena tenerlo en cuenta al comparar un test científicamente documentado con un producto comercial que te asigna a una categoría. El límite de la categoría se sitúa en una puntuación específica, y alguien un punto por debajo y alguien un punto por encima son, estadísticamente, la misma persona. La etiqueta de tipo lo oculta por completo, lo cual es uno de los argumentos más serios contra los instrumentos basados en tipos, y la razón por la que las puntuaciones continuas con error declarado son el estándar en la investigación.
Ponlo a prueba
Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.
Sigue leyendo
- ¿Qué es la psicometría?La disciplina que determina si una medición psicológica es válida y confiable, y la razón por la que dos pruebas que formulan preguntas similares pueden diferir enormemente en el valor de sus resultados.
- ¿Qué es la fiabilidad en las pruebas psicológicas?La fiabilidad es la consistencia de la medición, no su exactitud. Una prueba puede ser muy fiable y aun así medir algo equivocado, razón por la cual es la primera pregunta que se formula y nunca la última.
- ¿Qué es la validez en las pruebas psicológicas?La validez no es una propiedad que posea un test. Es un argumento sobre si una interpretación particular de una puntuación particular, para un propósito particular, es defendible — y debe reconstruirse para cada nuevo uso.
- ¿Qué es la validez de constructo?La pregunta más difícil en la medición: si aquello que estás midiendo existe tal como lo has definido, y si tu instrumento lo alcanza a él en lugar de algo adyacente.
- Validez convergente y discriminanteDos requisitos que son imagen especular el uno del otro: una medida debe coincidir con aquello con lo que debería coincidir, y debe mantenerse distinta de aquello de lo que afirma diferenciarse. La mayoría de los instrumentos débiles fallan en el segundo.
- Qué es el alfa de Cronbach y qué no esEl estadístico más reportado en la evaluación psicológica y el más malinterpretado. El alfa no indica que una escala sea unidimensional, y un valor alto suele ser un síntoma más que una virtud.
- Normas y percentiles: con qué se compara tu puntuaciónUna puntuación bruta es ininterpretable por sí sola. Solo adquiere significado frente a un grupo de referencia, y qué grupo se utilizó es uno de los hechos más determinantes y menos divulgados de cualquier test.
- Cómo se construye realmente una prueba psicométricaDesde la definición del constructo hasta las normas publicadas, el proceso lleva años y descarta la mayor parte de lo que se invierte en él. Conocer las etapas hace evidente cuáles omitió un cuestionario rápido en línea.
- ¿Qué significa que un test sea llamado validado?La palabra no está regulada y es utilizada libremente por productos que no han hecho ninguno de los trabajos requeridos. Esto es lo que significa cuando realmente significa algo, y las cuatro preguntas que separan ambos casos.
- Por qué la mayoría de los tests de personalidad en internet no son fiablesNo porque sean deshonestos, sino porque los pasos que hacen que una medición sea confiable son invisibles, costosos y fáciles de omitir, y omitirlos no cambia en nada el aspecto del resultado.
- Lo que la autoinforme puede y no puede medirLos cuestionarios te piden que seas el observador de ti mismo, lo cual funciona mejor para algunas cosas que para otras. Saber dónde el método es sólido y dónde falla cambia la forma en que interpretas cualquier resultado.
- Qué significa cuando una prueba predice algoUna correlación de 0,30 es un hallazgo sólido en la investigación de la personalidad y una base débil para tomar una decisión sobre una persona concreta. Ambas afirmaciones son verdaderas, y la brecha entre ellas explica la mayoría de los usos incorrectos de los resultados de las pruebas.
- El cribado no es diagnósticoUn cuestionario de cribado está diseñado para detectar el mayor número posible de casos, aceptando una alta tasa de falsos positivos como precio. Interpretar una puntuación de cribado como un diagnóstico invierte aquello para lo que fue concebido.