O que é o alfa de Cronbach — e o que ele não é
A estatística mais relatada nos testes psicológicos, e a mais mal interpretada. O alfa não indica que uma escala é unidimensional, e um valor elevado costuma ser sintoma, não virtude.
O alfa de Cronbach é um coeficiente de consistência interna: o grau em que os itens de uma escala se correlacionam entre si. Publicado em 1951, é a estatística psicométrica mais relatada na literatura, e sua ubiquidade superou sua utilidade.
O alfa varia de 0 a 1 e é determinado por dois fatores: a correlação média entre os itens e o número de itens. Essa segunda dependência é a fonte da maior parte dos equívocos.
O que um alfa elevado não significa
Não significa que a escala mede uma única coisa. Este é o erro mais comum. O alfa pode ser elevado em uma escala com dois ou três fatores distintos, desde que os itens se correlacionem suficientemente no geral. A unidimensionalidade deve ser estabelecida por análise fatorial; o alfa não pode estabelecê-la e nunca foi concebido para isso.
Não significa que a escala é válida. O alfa nada diz sobre o que os itens medem. Vinte questões sobre o tamanho do sapato teriam excelente consistência interna e validade nula como medida de qualquer construto psicológico.
Não significa que a escala é boa. Como o alfa aumenta com o número de itens, uma escala longa com itens mediocres superará uma escala curta com itens excelentes. Uma escala de quarenta itens com correlação média entre itens de 0,2 ultrapassa 0,90.
Um alfa muito elevado costuma ser um sinal de alerta. Acima de aproximadamente 0,95, os itens geralmente são quase paráfrases uns dos outros. Isso garante consistência à custa da abrangência do construto: a escala mede uma faceta estreita com grande precisão e deixa de lado o restante do construto. Isso é chamado de paradoxo da atenuação, e é por isso que mais consistência não é monotonicamente melhor.
O que ele pressupõe
O alfa é um limite inferior da fidedignidade sob uma suposição específica — a tau-equivalência, que significa que cada item contribui igualmente para o traço latente. Escalas reais quase nunca satisfazem essa condição. Os itens diferem na intensidade com que saturam o fator e, quando isso ocorre, o alfa subestima a fidedignidade.
O ômega de McDonald abandona a suposição de contribuição igual e estima a fidedignidade a partir das cargas fatoriais reais. Metodologistas o recomendam em detrimento do alfa há duas décadas. A prática de reporte tem sido lenta em acompanhar essa mudança, em grande parte porque o alfa é calculado com uma única linha em qualquer pacote estatístico, enquanto o ômega não.
Como interpretá-lo na prática
Convenções aproximadas: 0,70 ou mais é aceitável para pesquisas que comparam grupos; 0,80 ou mais para uso aplicado; 0,90 ou mais quando um escore influencia uma decisão individual. Trate esses valores como referência, não como limiares — o nível exigido depende das implicações da decisão que o escore fundamenta.
As informações mais relevantes geralmente estão em outras partes do mesmo artigo. A correlação média entre itens (entre 0,15 e 0,50 é uma faixa saudável) indica se o alfa elevado decorreu da qualidade ou da quantidade dos itens. O número de itens fornece a mesma informação pelo caminho inverso. A fidedignidade teste-reteste revela algo que o alfa estruturalmente não consegue revelar: se o escore é estável na mesma pessoa ao longo do tempo.
Uma escala que reporta apenas o alfa reportou o índice de fidedignidade mais fácil de obter — e o menos exigente de ser aprovado.
Ponha à prova
Ler sobre medida é uma coisa. Ver o seu próprio escore com a fonte, a amostra normativa e os limites declarados é outra. Gratuito, sem cadastro.
Continue lendo
- O que é psicometria?A disciplina que determina se uma medida psicológica tem valor real — e a razão pela qual dois testes com perguntas semelhantes podem diferir enormemente no que valem os seus resultados.
- O que é fidedignidade em testes psicológicos?Fidedignidade é a consistência da medição, não sua correção. Um teste pode ser altamente fidedigno e ainda assim medir a coisa errada — razão pela qual é a primeira pergunta a ser feita e nunca a última.
- O que é validade nos testes psicológicos?A validade não é uma propriedade que um teste possui. É um argumento sobre se uma interpretação específica de uma pontuação específica, para um propósito específico, é defensável — e precisa ser reconstruída a cada novo uso.
- O que é validade de construto?A pergunta mais difícil na mensuração: se aquilo que você está medindo existe da forma como você o definiu, e se o seu instrumento o alcança em vez de algo adjacente.
- Validade convergente e discriminanteDois requisitos em espelho: uma medida deve concordar com o que deveria concordar, e deve permanecer distinta daquilo que afirma não ser. A maioria dos instrumentos fracos falha no segundo.
- Erro padrão de medição: o quanto sua pontuação pode estar erradaToda pontuação carrega uma margem de erro e, na maioria dos testes psicológicos, ela é maior do que as pessoas supõem. Este é o número que indica quando uma diferença é real e quando é apenas ruído.
- Normas e percentis: com o que a sua pontuação é comparadaUma pontuação bruta é ininterpretável por si só. Torna-se significativa apenas em relação a um grupo de referência — e qual grupo foi utilizado é um dos factos mais consequentes e menos divulgados sobre qualquer teste.
- Como um teste psicométrico é realmente construídoDa definição do constructo às normas publicadas, o processo leva anos e descarta a maior parte do que foi investido nele. Conhecer as etapas torna óbvio quais delas um questionário online rápido ignorou.
- O que significa quando um teste é chamado de validado?A palavra não é regulamentada e é usada livremente por produtos que não fizeram nenhum trabalho. Veja o que significa quando tem algum significado, e as quatro perguntas que separam os dois casos.
- Por que a maioria dos testes de personalidade na internet não são confiáveisNão porque sejam desonestos, mas porque as etapas que tornam uma medição confiável são invisíveis, custosas e fáceis de ignorar — e ignorá-las não muda nada na aparência do resultado.
- O que o autorrelato pode e não pode medirOs questionários pedem que você seja o observador de si mesmo, o que funciona melhor para algumas coisas do que para outras. Saber onde o método é forte e onde falha muda a forma como você interpreta qualquer resultado.
- O que significa quando um teste prevê algoUma correlação de 0,30 é um achado robusto na pesquisa de personalidade e uma base fraca para uma decisão sobre uma pessoa específica. Ambas as afirmações são verdadeiras, e a lacuna entre elas é a causa do mau uso dos resultados de testes.
- Triagem não é diagnósticoUm questionário de triagem é construído para identificar o maior número possível de casos, aceitando uma alta taxa de falsos positivos como contrapartida. Interpretar uma pontuação de triagem como diagnóstico inverte aquilo para o qual foi concebido.