Що таке альфа Кронбаха і чим вона не є
Найчастіше повідомлювана статистика в психологічному тестуванні і та, яку найчастіше неправильно тлумачать. Альфа не говорить вам, що шкала є одновимірною, а високе значення часто є радше симптомом, ніж перевагою.
Альфа Кронбаха є коефіцієнтом внутрішньої узгодженості: це ступінь, до якого пункти шкали корелюють один з одним. Опублікований у 1951 році, він є найпоширенішим психометричним статистичним показником у звітах, і його повсюдність вже перевершила його корисність.
Альфа варіюється від 0 до 1 і визначається двома речами: середньою кореляцією між пунктами та кількістю пунктів. Ця друга залежність є джерелом більшості непорозумінь.
Що не означає висока альфа
Це не означає, що шкала вимірює щось одне. Це найпоширеніша помилка. Альфа може бути високою для шкали з двома або трьома різними факторами, якщо пункти загалом достатньо корелюють. Одновимірність має бути встановлена за допомогою факторного аналізу; альфа не може цього встановити і ніколи не була для цього призначена.
Це не означає, що шкала є валідною. Альфа нічого не говорить про те, що саме вимірюють пункти. Двадцять запитань про розмір взуття мали б чудову внутрішню узгодженість і нульову валідність як засіб вимірювання будь-чого психологічного.
Це не означає, що шкала є хорошою. Оскільки альфа зростає зі збільшенням кількості пунктів, довга шкала з посередніми пунктами отримає вищий бал, ніж коротка шкала з відмінними. Шкала з сорока пунктів із середньою кореляцією між пунктами 0.2 досягає значення вище 0.90.
Дуже висока альфа часто є попередженням. Вище приблизно 0.95 пункти зазвичай є майже перефразуваннями один одного. Це купує узгодженість ціною охоплення конструкту: шкала дуже точно вимірює один вузький аспект і пропускає решту конструкту. Це називається парадоксом атенюації, і саме тому більша узгодженість не є монотонно кращою.
Що вона припускає
Альфа є нижньою межею надійності за певного припущення: тау-еквівалентності, що означає, що кожен пункт робить однаковий внесок у базову рису. Реальні шкали майже ніколи не задовольняють цю умову. Пункти відрізняються тим, наскільки сильно вони навантажують фактор, і коли це так, альфа недооцінює надійність.
Омега Макдональда відкидає припущення про однаковий внесок і оцінює надійність на основі фактичних факторних навантажень. Методологи рекомендують її замість альфи вже два десятиліття. Практика звітування змінюється повільно, здебільшого тому, що альфа є в одному рядку в кожному статистичному пакеті, а омега відсутня.
Читання на практиці
Орієнтовні правила: 0.70 і вище є прийнятним для досліджень, що порівнюють групи, 0.80 і вище для прикладного використання, 0.90 і вище там, де бал впливає на індивідуальне рішення. Розглядайте це як орієнтири, а не пороги; необхідний рівень залежить від значущості рішення, на яке впливає бал.
Більш інформативні цифри зазвичай знаходяться деінде в тій самій статті. Середня кореляція між пунктами (від 0.15 до 0.50 є здоровим діапазоном) говорить вам, чи висока альфа зумовлена якістю пунктів, чи їх кількістю. Кількість пунктів говорить вам про те саме з іншого боку. Тест-ретестова надійність говорить вам те, чого альфа структурно не може: чи є бал стабільним у тієї ж людини з плином часу.
Шкала, що звітує лише про альфу, повідомила про найлегший для отримання показник надійності, і найменш вимогливий для проходження.
Перевірте себе
Читати про вимірювання одне. Побачити власний бал із зазначенням джерела, нормативної вибірки та обмежень зовсім інше. Безкоштовно, без реєстрації.
Читати далі
- Що таке психометрика?Дисципліна, яка визначає, чи якісним є психологічне вимірювання, і причина, чому два тести зі схожими запитаннями можуть надзвичайно різнитися за цінністю своїх результатів.
- Що таке надійність у психологічному тестуванні?Надійність це узгодженість вимірювання, а не правильність. Тест може мати високу надійність і все одно вимірювати не те. Саме тому це перше запитання, яке ставлять, але ніколи не останнє.
- Що таке валідність у психологічному тестуванні?Валідність це не властивість, яку має тест. Це аргумент про те, чи є конкретна інтерпретація конкретного бала для конкретної мети обґрунтованою, і його потрібно заново вибудовувати для кожного нового застосування.
- Що таке валідність конструкту?Найскладніше запитання у вимірюванні: чи існує те, що ви вимірюєте, так, як ви це визначили, і чи ваш інструмент досягає саме його, а не чогось суміжного.
- Конвергентна та дискримінантна валідністьДві дзеркальні вимоги: вимір має узгоджуватися з тим, з чим має узгоджуватися, і має залишатися відмінним від того, чим він заявляє, що не є. Більшість слабких інструментів не виконують другу вимогу.
- Стандартна похибка вимірювання: наскільки ваш бал може відхилятисяКожен бал має похибку вимірювання, і для більшості психологічних тестів вона ширша, ніж ви припускаєте. Саме це число показує, коли різниця є реальною, а коли це шум.
- Норми та процентилі: з чим порівнюється ваш балСирий бал сам по собі не піддається інтерпретації. Він набуває значення лише у порівнянні з референтною групою, і те, яка саме група була використана, є одним із найважливіших і найменш розголошуваних фактів про будь-який тест.
- Як насправді створюється психометричний тестВід визначення конструкту до опублікованих норм послідовність триває роки і відсіює більшу частину того, з чого вона починалася. Знання цих етапів робить очевидним, які з них пропустив швидкий онлайн-тест.
- Що означає, коли тест називають валідизованим?Це слово не регулюється і вільно використовується продуктами, які не виконали жодної роботи. Ось що воно означає, коли воно щось означає, і чотири запитання, які розрізняють ці два випадки.
- Чому більшість особистісних тестів в інтернеті не є надійнимиНе тому, що вони нечесні, а тому, що кроки, які роблять вимірювання надійним, непомітні, дорогі, і їх легко пропустити. Їх пропуск жодним чином не змінює вигляд результату.
- Що самозвіт може і не може вимірюватиОпитувальники пропонують вам бути спостерігачем себе, що працює краще для одних речей, ніж для інших. Розуміння того, де метод сильний, а де він не спрацьовує, змінює те, як ви читаєте будь-який результат.
- Що означає, коли тест щось прогнозуєКореляція 0.30 є сильним результатом у дослідженнях особистості та слабкою підставою для рішення щодо однієї людини. Обидва твердження правдиві, і розрив між ними спричиняє більшість випадків неправильного використання результатів тестів.
- Скринінг не є діагнозомСкринінговий опитувальник створений для виявлення якомога більшої кількості можливих випадків, приймаючи високу частоту хибнопозитивних результатів як ціну. Тлумачення скринінгового бала як діагнозу спотворює те, для чого він був створений.