Что такое альфа Кронбаха и чем она не является
Самая часто упоминаемая статистика в психологическом тестировании и самая неправильно понимаемая. Альфа не говорит о том, что шкала одномерна, а высокое значение часто является симптомом, а не достоинством.
Альфа Кронбаха представляет собой коэффициент внутренней согласованности: степень, в которой пункты шкалы коррелируют друг с другом. Опубликованная в 1951 году, она является самой часто упоминаемой психометрической статистикой, и её распространённость опередила её полезность.
Альфа принимает значения от 0 до 1 и зависит от двух факторов: средней корреляции между пунктами и количества пунктов. Именно эта вторая зависимость является источником большинства заблуждений.
Что не означает высокая альфа
Это не означает, что шкала измеряет что-то одно. Это самая распространённая ошибка. Альфа может быть высокой для шкалы с двумя или тремя различными факторами, если пункты в целом достаточно сильно коррелируют. Одномерность должна устанавливаться с помощью факторного анализа; альфа не может это установить и никогда для этого не предназначалась.
Это не означает, что шкала валидна. Альфа ничего не говорит о том, что измеряют пункты. Двадцать вопросов о размере обуви имели бы отличную внутреннюю согласованность и нулевую валидность как мера чего-либо психологического.
Это не означает, что шкала хороша. Поскольку альфа растёт с увеличением количества пунктов, длинная шкала из посредственных пунктов превзойдёт по значению короткую шкалу из отличных пунктов. Шкала из сорока пунктов со средней межпунктовой корреляцией 0.2 достигает значения выше 0.90.
Очень высокая альфа часто является предупреждающим сигналом. При значениях выше примерно 0.95 пункты обычно представляют собой почти перефразированные варианты друг друга. Это достигается ценой охвата конструкта: шкала очень точно измеряет одну узкую грань, но упускает остальную часть конструкта. Это явление называется парадоксом затухания, и именно поэтому большая согласованность не всегда является улучшением.
Что она предполагает
Альфа представляет собой нижнюю границу надёжности при определённом допущении: тау-эквивалентности, то есть предположении, что каждый пункт вносит равный вклад в измеряемую черту. Реальные шкалы почти никогда не удовлетворяют этому условию. Пункты различаются по силе своей факторной нагрузки, и когда это происходит, альфа занижает надёжность.
Омега Макдональда отказывается от допущения о равном вкладе и оценивает надёжность на основе фактических факторных нагрузок. Методологи рекомендуют её вместо альфы уже два десятилетия. Практика отчётности медленно следует этой рекомендации, во многом потому, что альфа выводится одной строкой в любом статистическом пакете, а омега нет.
Как читать её на практике
Приблизительные ориентиры: 0.70 и выше приемлемо для исследований, сравнивающих группы, 0.80 и выше для прикладного применения, 0.90 и выше там, где балл влияет на индивидуальное решение. Относитесь к этим значениям как к ориентирам, а не строгим порогам: необходимый уровень зависит от значимости решения, которое принимается на основе балла.
Более информативные показатели обычно приводятся в других частях той же статьи. Средняя межпунктовая корреляция (здоровый диапазон от 0.15 до 0.50) показывает, обусловлена ли высокая альфа качеством пунктов или их количеством. Количество пунктов показывает то же самое с другой стороны. Ретестовая надёжность показывает то, что альфа структурно показать не может: стабилен ли балл у одного и того же человека с течением времени.
Шкала, для которой указана только альфа, сообщает о самом простом в получении показателе надёжности, и о самом нетребовательном для прохождения.
Проверьте это на практике
Читать об измерении, это одно. Увидеть собственный балл с указанием источника, нормативной выборки и ограничений, это другое. Прохождение бесплатно, регистрация не требуется.
Продолжить чтение
- Что такое психометрика?Дисциплина, которая определяет, насколько хорошо психологическое измерение выполняет свою задачу, и причина того, что два теста, задающих похожие вопросы, могут сильно различаться по ценности своих результатов.
- Что такое надёжность в психологическом тестировании?Надёжность, это постоянство измерения, а не его правильность. Тест может быть высоко надёжным и при этом измерять не то, что нужно, поэтому это первый вопрос, который задают, и никогда не последний.
- Что такое валидность в психологическом тестировании?Валидность, это не свойство, которым обладает тест. Это аргументация о том, можно ли считать обоснованной конкретную интерпретацию конкретного балла для конкретной цели, и её нужно выстраивать заново для каждого нового применения.
- Что такое конструктная валидность?Самый сложный вопрос в измерении: существует ли то, что вы измеряете, в том виде, в каком вы это определили, и достигает ли ваша методика именно этого, а не чего-то смежного.
- Конвергентная и дискриминантная валидностьДва взаимно противоположных требования: методика должна согласовываться с тем, с чем должна согласовываться, и оставаться отличимой от того, чем она заявляет, что не является. Большинство слабых методик не справляются со вторым.
- Стандартная ошибка измерения: насколько ваш балл может отличаться от истинного значенияКаждый балл несёт погрешность измерения, и для большинства психологических тестов она шире, чем принято считать. Именно эта величина подсказывает, когда различие реально, а когда это просто шум.
- Нормы и процентили: с чем сравнивается ваш баллНеобработанный балл сам по себе неинтерпретируем. Он приобретает смысл только в сравнении с референтной группой, и то, какая группа использовалась, один из самых значимых и наименее освещаемых фактов о любом тесте.
- Как на самом деле создаётся психометрический тестОт определения конструкта до опубликованных норм этот путь занимает годы и отбрасывает большую часть того, что в него вложено. Знание этих этапов делает очевидным, какие из них были пропущены быстрым онлайн-квизом.
- Что значит, что тест является валидированным?Это слово никем не регулируется и свободно используется продуктами, которые не проделали никакой соответствующей работы. Вот что оно означает, когда действительно что-то значит, и четыре вопроса, которые отличают один случай от другого.
- Почему большинство интернет-тестов личности не являются надёжнымиНе потому, что они нечестны, а потому, что шаги, делающие измерение надёжным, невидимы, дороги и легко пропускаются, а их пропуск никак не меняет внешний вид результата.
- Что может и не может измерить самоотчётОпросники просят вас быть наблюдателем самого себя, а это работает лучше для одних вещей и хуже для других. Понимание того, где метод силён, а где даёт сбои, меняет то, как вы читаете любой результат.
- Что значит, когда тест что-то предсказываетКорреляция 0,30, это весомый результат в исследованиях личности и слабое основание для решения об одном конкретном человеке. Оба утверждения верны, и разрыв между ними является причиной большинства случаев неправильного использования результатов теста.
- Скрининг не является диагностикойСкрининговый опросник создан для того, чтобы выявить как можно больше возможных случаев, принимая высокую долю ложноположительных результатов как цену за это. Восприятие скринингового балла как диагноза искажает саму цель, ради которой он был создан.