Normas e percentis: com o que a sua pontuação é comparada
Uma pontuação bruta é ininterpretável por si só. Torna-se significativa apenas em relação a um grupo de referência — e qual grupo foi utilizado é um dos factos mais consequentes e menos divulgados sobre qualquer teste.
Você obtém 34 numa escala de conscienciosidade. Isso é alto?
A pergunta não tem resposta sem uma comparação. Trinta e quatro de qual máximo, em relação a quem, medido quando? As normas são os dados de referência que transformam uma pontuação bruta numa posição interpretável, e escolhê-las é uma das decisões mais consequentes na construção de testes.
Como funciona a conversão
Uma amostra normativa é um grupo de pessoas que realizou o instrumento em condições padronizadas, cuja distribuição de pontuações se torna a régua de medida. As pontuações brutas são então expressas como uma posição dentro dessa distribuição.
Ranks percentílicos indicam a proporção da amostra normativa que obteve uma pontuação igual ou inferior à sua. O percentil 70 significa que 70 por cento desse grupo de referência obteve pontuação mais baixa. Os percentis são intuitivos e têm uma falha subestimada: esticam as diferenças na parte central e congestionada da distribuição e comprimem-nas nas extremidades. Alguns pontos brutos em torno da média podem movê-lo muitos lugares percentílicos; os mesmos poucos pontos perto do topo movem-no quase nada.
Pontuações padronizadas — z-scores, T-scores, stanines, escalas ao estilo QI — expressam a distância da média em unidades de desvio padrão. Preservam o espaçamento real entre pontuações, razão pela qual são preferidas para qualquer coisa que envolva aritmética sobre os resultados.
Por que o grupo de referência é tudo
A mesma pontuação bruta pode situar-se em percentis muito diferentes dependendo da amostra normativa. A conscienciosidade pontuada em relação a uma população adulta geral e em relação a uma amostra de contabilistas em exercício não produzirá o mesmo percentil, e nenhum dos números está errado — respondem a perguntas diferentes.
Isso torna várias propriedades de uma amostra normativa dignas de conhecimento.
Quem estava nela. Amostras de conveniência de estudantes universitários de psicologia ainda são comuns e representam uma fatia estreita da humanidade: jovens, instruídos e desproporcionalmente provenientes de países ocidentais ricos. Uma norma construída sobre elas viaja mal.
Qual era o seu tamanho. Estimativas percentílicas estáveis nas caudas requerem amostras grandes. Algumas centenas de pessoas fornecem uma imagem pouco fiável do aspeto do percentil 95.
Quando foi recolhida. As normas derivam. As médias populacionais numa série de medidas psicológicas deslocaram-se mensuravelmente ao longo de décadas, e uma amostra normativa de 1995 já não descreve a população que realiza o teste em 2026.
Se está estratificada. Muitos traços variam sistematicamente por idade e sexo. A procura de sensações declina acentuadamente com a idade; o cronotipo muda ao longo da vida. Comparar uma pessoa de 55 anos com uma norma de todas as idades produz uma posição enganosa em ambas.
O que procurar, e o que a sua ausência significa
Um instrumento bem documentado indica o tamanho, composição, país e ano da sua amostra normativa, e declara se as normas estão estratificadas. Os manuais de testes sérios dedicam capítulos a isto.
A maioria dos testes gratuitos online não reporta nada disso. Apresentam-lhe um percentil sem qualquer indicação da população a que se refere. Esse percentil é derivado de uma amostra de conveniência não declarada, emprestado de uma norma publicada recolhida numa população diferente, ou produzido a partir das pessoas que previamente realizaram o teste nesse website — um grupo autoasselecionado cuja composição é desconhecida até para o próprio operador do site.
O percentil continua a aparecer no ecrã e parece igual a um real. É a documentação que o acompanha, e só ela, que separa os dois.
Ponha à prova
Ler sobre medida é uma coisa. Ver o seu próprio escore com a fonte, a amostra normativa e os limites declarados é outra. Gratuito, sem cadastro.
Continue lendo
- O que é psicometria?A disciplina que determina se uma medida psicológica tem valor real — e a razão pela qual dois testes com perguntas semelhantes podem diferir enormemente no que valem os seus resultados.
- O que é fidedignidade em testes psicológicos?Fidedignidade é a consistência da medição, não sua correção. Um teste pode ser altamente fidedigno e ainda assim medir a coisa errada — razão pela qual é a primeira pergunta a ser feita e nunca a última.
- O que é validade nos testes psicológicos?A validade não é uma propriedade que um teste possui. É um argumento sobre se uma interpretação específica de uma pontuação específica, para um propósito específico, é defensável — e precisa ser reconstruída a cada novo uso.
- O que é validade de construto?A pergunta mais difícil na mensuração: se aquilo que você está medindo existe da forma como você o definiu, e se o seu instrumento o alcança em vez de algo adjacente.
- Validade convergente e discriminanteDois requisitos em espelho: uma medida deve concordar com o que deveria concordar, e deve permanecer distinta daquilo que afirma não ser. A maioria dos instrumentos fracos falha no segundo.
- O que é o alfa de Cronbach — e o que ele não éA estatística mais relatada nos testes psicológicos, e a mais mal interpretada. O alfa não indica que uma escala é unidimensional, e um valor elevado costuma ser sintoma, não virtude.
- Erro padrão de medição: o quanto sua pontuação pode estar erradaToda pontuação carrega uma margem de erro e, na maioria dos testes psicológicos, ela é maior do que as pessoas supõem. Este é o número que indica quando uma diferença é real e quando é apenas ruído.
- Como um teste psicométrico é realmente construídoDa definição do constructo às normas publicadas, o processo leva anos e descarta a maior parte do que foi investido nele. Conhecer as etapas torna óbvio quais delas um questionário online rápido ignorou.
- O que significa quando um teste é chamado de validado?A palavra não é regulamentada e é usada livremente por produtos que não fizeram nenhum trabalho. Veja o que significa quando tem algum significado, e as quatro perguntas que separam os dois casos.
- Por que a maioria dos testes de personalidade na internet não são confiáveisNão porque sejam desonestos, mas porque as etapas que tornam uma medição confiável são invisíveis, custosas e fáceis de ignorar — e ignorá-las não muda nada na aparência do resultado.
- O que o autorrelato pode e não pode medirOs questionários pedem que você seja o observador de si mesmo, o que funciona melhor para algumas coisas do que para outras. Saber onde o método é forte e onde falha muda a forma como você interpreta qualquer resultado.
- O que significa quando um teste prevê algoUma correlação de 0,30 é um achado robusto na pesquisa de personalidade e uma base fraca para uma decisão sobre uma pessoa específica. Ambas as afirmações são verdadeiras, e a lacuna entre elas é a causa do mau uso dos resultados de testes.
- Triagem não é diagnósticoUm questionário de triagem é construído para identificar o maior número possível de casos, aceitando uma alta taxa de falsos positivos como contrapartida. Interpretar uma pontuação de triagem como diagnóstico inverte aquilo para o qual foi concebido.