noesisnoesis
Cómo se mide

Error estándar de medición: cuánto puede desviarse tu puntuación

Toda puntuación lleva un margen de error, y en la mayoría de los tests psicológicos es más amplio de lo que la gente supone. Este es el número que te indica cuándo una diferencia es real y cuándo es ruido.

El error estándar de medición convierte un coeficiente de fiabilidad abstracto en algo concreto: una banda de más o menos alrededor de una puntuación. Responde a la pregunta que la mayoría de las pantallas de resultados dejan sin responder: ¿cuánto podría haber variado este número si hubiera hecho el test en otra tarde?

La fórmula es sencilla. Multiplica la desviación típica de la escala por la raíz cuadrada de uno menos su fiabilidad. Para una escala con una desviación típica de 10 y una fiabilidad de 0,85, el error estándar es de aproximadamente 3,9 puntos.

Lo que esa banda cubre realmente

Aproximadamente dos tercios de las veces, la posición verdadera de una persona se encuentra dentro de un error estándar de su puntuación observada. Para tener una confianza de aproximadamente el 95 por ciento, se necesitan aproximadamente dos errores estándar a cada lado.

Tomemos el ejemplo anterior. Alguien obtiene una puntuación de 62. El intervalo del 95 por ciento va desde aproximadamente 54 hasta 70. Eso es una ventana de dieciséis puntos en una escala donde la diferencia típica entre la media y claramente por encima de la media podría ser de diez puntos.

Esto no es un defecto de ese test en particular. Una fiabilidad de 0,85 es respetable. Es la precisión normal de la medición psicológica, y es la razón por la que los informes rigurosos presentan bandas en lugar de puntos.

Las consecuencias que la gente pasa por alto

Las pequeñas diferencias entre escalas suelen carecer de significado. Si tu extraversión es 58 y tu apertura es 54, la lectura honesta es que son indistinguibles. Las interpretaciones de perfil que construyen una narrativa a partir de diferencias de cuatro puntos están leyendo ruido.

Los pequeños cambios a lo largo del tiempo también suelen carecer de significado. Repetir un test y subir cinco puntos está dentro del error para la mayoría de los instrumentos. El cambio real de un rasgo ocurre a lo largo de años y se manifiesta como un movimiento claramente fuera de la banda de error, no como unos pocos puntos de mes a mes.

Los ordenamientos por rango amplifican el problema. Una diferencia de unos pocos puntos brutos puede mover a alguien diez posiciones percentilares en la zona central densa de una distribución, porque ahí es donde se sitúa la mayoría de las personas. Los rangos percentilares parecen precisos y son la forma menos estable de expresar una puntuación.

La precisión no es uniforme a lo largo de la escala. La teoría clásica de los tests asume un único valor de error para cada puntuación, lo cual es una simplificación. La teoría de respuesta al ítem modela el error por separado en cada nivel del rasgo, y casi siempre es mayor en los extremos, precisamente donde se realizan las interpretaciones más trascendentes. Una puntuación muy alta o muy baja suele ser menos precisa que una intermedia, no más.

Por qué los informes honestos parecen menos impresionantes

Un instrumento que presenta bandas de confianza parece más impreciso que uno que reporta un único número con un decimal. El que parece más impreciso está diciendo la verdad. El que parece preciso tiene el mismo error subyacente y ha elegido no mostrarlo.

Esto vale la pena tenerlo en cuenta al comparar un test científicamente documentado con un producto comercial que te asigna a una categoría. El límite de la categoría se sitúa en una puntuación específica, y alguien un punto por debajo y alguien un punto por encima son, estadísticamente, la misma persona. La etiqueta de tipo lo oculta por completo, lo cual es uno de los argumentos más serios contra los instrumentos basados en tipos, y la razón por la que las puntuaciones continuas con error declarado son el estándar en la investigación.

Ponlo a prueba

Leer sobre medición es una cosa. Ver tu propia puntuación con su fuente, su muestra normativa y sus límites es otra. Gratis, sin registro.

Sigue leyendo