noesisnoesis
Como se mede

Erro padrão de medição: o quanto sua pontuação pode estar errada

Toda pontuação carrega uma margem de erro e, na maioria dos testes psicológicos, ela é maior do que as pessoas supõem. Este é o número que indica quando uma diferença é real e quando é apenas ruído.

O erro padrão de medição converte um coeficiente de fidedignidade abstrato em algo concreto: uma faixa de mais ou menos em torno de uma pontuação. Ele responde à pergunta que a maioria das telas de resultados deixa sem resposta — o quanto esse número poderia ter diferido se eu tivesse feito o teste em outra tarde?

A fórmula é simples. Multiplique o desvio padrão da escala pela raiz quadrada de um menos sua fidedignidade. Para uma escala com desvio padrão de 10 e fidedignidade de 0,85, o erro padrão é de cerca de 3,9 pontos.

O que essa faixa realmente abrange

Aproximadamente dois terços das vezes, o resultado verdadeiro de uma pessoa se encontra dentro de um erro padrão de sua pontuação observada. Para ter cerca de 95 por cento de confiança, são necessários aproximadamente dois erros padrão para cada lado.

Tome o exemplo acima. Alguém pontua 62. O intervalo de 95 por cento vai de cerca de 54 a 70. Isso é uma janela de dezesseis pontos em uma escala onde a diferença típica entre a média e claramente acima da média pode ser de dez pontos.

Isso não é um defeito desse teste em particular. Uma fidedignidade de 0,85 é respeitável. É a precisão normal da mensuração psicológica, e é o motivo pelo qual relatórios cuidadosos apresentam faixas em vez de pontos.

As consequências que as pessoas ignoram

Pequenas diferenças entre escalas geralmente não têm significado. Se sua extroversão é 58 e sua abertura é 54, a leitura honesta é que elas são indistinguíveis. Interpretações de perfil que constroem uma narrativa a partir de diferenças de quatro pontos estão lendo ruído.

Pequenas mudanças ao longo do tempo também geralmente não têm significado. Refazer um teste e avançar cinco pontos está dentro do erro para a maioria dos instrumentos. A mudança real de traço acontece ao longo de anos e aparece como um movimento bem além da faixa de erro, não como alguns pontos de mês a mês.

Ordenações por classificação amplificam o problema. Uma diferença de alguns pontos brutos pode mover alguém dez posições percentuais na parte central e densa de uma distribuição, porque é onde a maioria das pessoas está. As classificações percentis parecem precisas e são a forma menos estável de expressar uma pontuação.

A precisão não é uniforme ao longo da escala. A teoria clássica dos testes assume um valor de erro para cada pontuação, o que é uma simplificação. A teoria de resposta ao item modela o erro separadamente em cada nível do traço, e ele é quase sempre maior nos extremos — precisamente onde as interpretações mais consequentes são feitas. Uma pontuação muito alta ou muito baixa é tipicamente menos precisa do que uma intermediária, não mais.

Por que a comunicação honesta parece menos impressionante

Um instrumento que apresenta intervalos de confiança parece mais vago do que aquele que apresenta um único número com uma casa decimal. O mais vago está dizendo a verdade. O que parece preciso tem o mesmo erro subjacente e escolheu não mostrá-lo.

Vale lembrar disso ao comparar um teste cientificamente documentado com um produto comercial que o classifica em uma categoria. O limite da categoria está em uma pontuação específica, e alguém um ponto abaixo e alguém um ponto acima são, estatisticamente, a mesma pessoa. O rótulo de tipo oculta isso completamente — o que é um dos argumentos mais sérios contra instrumentos baseados em tipos, e a razão pela qual pontuações contínuas com erro declarado são o padrão na pesquisa.

Ponha à prova

Ler sobre medida é uma coisa. Ver o seu próprio escore com a fonte, a amostra normativa e os limites declarados é outra. Gratuito, sem cadastro.

Continue lendo