noesisnoesis
Como se mede

Por que a maioria dos testes de personalidade na internet não são confiáveis

Não porque sejam desonestos, mas porque as etapas que tornam uma medição confiável são invisíveis, custosas e fáceis de ignorar — e ignorá-las não muda nada na aparência do resultado.

Um teste de personalidade gratuito online e um instrumento psicométrico validado produzem resultados que parecem idênticos: uma pontuação, um percentil, um parágrafo descrevendo você. A diferença está inteiramente no trabalho que você não consegue ver na tela de resultados.

Vale a pena ser preciso sobre isso, porque o enquadramento habitual — de que os testes da internet são fraudes — está em grande parte errado e não é muito útil. A maioria é feita por pessoas sem intenção de enganar. Eles são não confiáveis por razões estruturais.

O que normalmente é ignorado

Análise de itens. Em uma escala construída adequadamente, a maioria dos itens redigidos é descartada após o teste piloto: itens em que ninguém varia, itens que se correlacionam mal com o total, itens que carregam em mais de um fator, itens que se comportam de forma diferente entre grupos de idade ou idioma. Um teste escrito e publicado sem piloto manteve tudo, incluindo os itens que não funcionam.

Confirmação estrutural independente. A análise fatorial nos dados a partir dos quais você construiu a escala recuperará a estrutura que você projetou. Confirmá-la em uma amostra nova é um estudo separado, e é a etapa em que uma grande parcela das escalas falha.

Normas. O percentil precisa vir de algum lugar. Se o site não especifica sua população de referência, o número é derivado de visitantes anteriores — um grupo autosselecionado de composição desconhecida — ou de nada em particular.

Dados de teste-reteste. Verificar que as pessoas obtêm a mesma pontuação no mês seguinte exige encontrá-las novamente. Quase ninguém faz isso, o que significa que a estabilidade que a palavra "traço" implica não foi demonstrada.

Os incentivos de design apontam na direção errada

Um teste construído para engajamento é otimizado para um resultado diferente de um teste construído para precisão, e os dois se afastam de maneiras previsíveis.

Resultados lisonjeiros têm melhor desempenho. Um resultado que lhe diz algo desagradável é menos compartilhado, então os resultados tendem a derivar para descrições que todos reconhecem em si mesmos. Este é o efeito Barnum, demonstrado na década de 1940 e reproduzido de forma consistente desde então: as pessoas avaliam descrições genéricas de personalidade como altamente precisas sobre si mesmas especificamente.

Tipos têm melhor desempenho do que dimensões. "Você é um Arquiteto" é mais compartilhável do que "você está no 68º percentil em abertura com um amplo intervalo de confiança". Os tipos também ocultam o erro de medição, já que alguém com um ponto para cada lado do limite de uma categoria recebe rótulos completamente diferentes.

Testes curtos têm melhor desempenho do que os adequados. Cada pergunta adicional faz com que respondentes abandonem o teste, então os testes são reduzidos a um tamanho que maximiza a conclusão em vez de cobrir o construto.

Nada disso são mentiras. São otimizações para uma métrica diferente de precisão.

Como identificar em cerca de trinta segundos

Procure um instrumento de origem nomeado com autores e ano. Procure uma declaração de qual população as normas são provenientes. Procure qualquer reconhecimento de limitações ou erro de medição. Verifique se o resultado é uma pontuação contínua ou uma categoria. Verifique se a mesma página também promete identificar sua carreira ideal, parceiro ou propósito de vida a partir de vinte perguntas.

Um teste que nomeia seu instrumento, cita sua fonte, declara suas normas e diz o que não pode informar fez o trabalho necessário. Um que não faz nada disso ainda pode ser uma forma agradável de passar cinco minutos — mas o número que produz é apenas decoração.

Cada instrumento no catálogo NOESIS declara qual teste publicado implementa, quem o escreveu, em que ano, como é pontuado e o que seus resultados não estabelecem. Essa última parte é a que vale comparar.

Ponha à prova

Ler sobre medida é uma coisa. Ver o seu próprio escore com a fonte, a amostra normativa e os limites declarados é outra. Gratuito, sem cadastro.

Continue lendo