Що таке надійність у психологічному тестуванні?
Надійність це узгодженість вимірювання, а не правильність. Тест може мати високу надійність і все одно вимірювати не те. Саме тому це перше запитання, яке ставлять, але ніколи не останнє.
Надійність це ступінь, до якого вимірювання є відтворюваним, а не шумом. Якщо ви тричі зважитеся протягом хвилини й отримаєте 71, 78 і 66 кілограмів, шкала буде ненадійною, і ви ніяк не зможете дізнатися з неї свою справжню вагу. Психологічне вимірювання стикається з тією самою проблемою за значно менш точного обладнання.
Головне, що варто зрозуміти про надійність, це те, чого вона не стверджує. Вага для ванної кімнати, яка стабільно показує на вісім кілограмів більше, є цілком надійною і водночас повністю неправильною. Надійність стосується узгодженості; чи означає число правильну річ, це окреме питання, яке називається валідністю. Надійність є необхідною для валідності, але далеко не достатньою для неї.
Форми, яких вона набуває
Внутрішня узгодженість запитує, чи узгоджуються між собою пункти шкали. Якщо десять запитань мають вимірювати ту саму базову рису, люди, які дають високу відповідь на одне, мають схилятися давати високі відповіді й на інші. Про це зазвичай повідомляють як альфу Кронбаха або, краще, омегу Макдональда.
Ретестова надійність запитує, чи та сама людина отримує подібні бали у двох випадках. Це форма, яка найважливіша для рис, які за визначенням мають бути стабільними. Це також форма, про яку найчастіше не повідомляють, бо вона вимагає розшукати тих самих учасників тижнями пізніше.
Надійність між оцінювачами застосовується, коли інструмент оцінюють люди: клінічні інтерв'ю, проєктивні методики, спостереження за поведінкою. Вона запитує, чи доходять двоє підготовлених оцінювачів, розглядаючи той самий матеріал, того самого висновку.
Надійність паралельних форм запитує, чи дають дві різні версії того самого тесту, створені як еквівалентні, однакові бали. Вона важлива скрізь, де тест проходять більше ніж один раз і де оприлюднення пунктів викликає занепокоєння.
Як читати числа
Коефіцієнти надійності йдуть від 0 до 1. Конвенції є приблизними і їх широко зловживають, але приблизно так: вище 0.90 вимагається там, де бал впливає на життя людини, від 0.80 до 0.90 є міцним для більшості прикладного використання, від 0.70 до 0.80 є прийнятним для досліджень і для групових порівнянь, а нижче 0.70 означає, що бал містить більше шуму, ніж може витримати більшість висновків.
Два застереження щодо цих порогів. По-перше, це конвенції, а не закони, прийнятний рівень цілком залежить від того, для чого використовуватимуть бал. По-друге, дуже висока альфа на короткій шкалі зазвичай вказує, що пункти є майже перефразуваннями один одного, що дає узгодженість ціною охоплення конструкту. Шкала з десяти запитань, які трохи різними словами запитують «ви організовані?», матиме чудову внутрішню узгодженість і вузьке прочитання сумлінності.
Що це означає для вашого власного бала
Надійність прямо перетворюється на те, наскільки великої довіри заслуговує одне число. Тест із надійністю 0.85 несе похибку вимірювання, достатньо велику, щоб різниця в кілька балів між двома людьми або між вашим балом сьогодні і вашим балом минулого місяця дуже ймовірно була шумом, а не сигналом.
Це і є практичний наслідок: добрий інструмент повідомляє свою надійність, щоб ви знали, наскільки широкою є невизначеність навколо вашого бала. Технічним вираженням цієї невизначеності є стандартна похибка вимірювання, яка перетворює коефіцієнт надійності на смугу плюс-мінус навколо бала.
Інструмент, який взагалі не повідомляє жодного показника надійності, не є завдяки цьому точнішим. Він просто відмовився сказати вам, наскільки він неточний.
Перевірте себе
Читати про вимірювання одне. Побачити власний бал із зазначенням джерела, нормативної вибірки та обмежень зовсім інше. Безкоштовно, без реєстрації.
Читати далі
- Що таке психометрика?Дисципліна, яка визначає, чи якісним є психологічне вимірювання, і причина, чому два тести зі схожими запитаннями можуть надзвичайно різнитися за цінністю своїх результатів.
- Що таке валідність у психологічному тестуванні?Валідність це не властивість, яку має тест. Це аргумент про те, чи є конкретна інтерпретація конкретного бала для конкретної мети обґрунтованою, і його потрібно заново вибудовувати для кожного нового застосування.
- Що таке валідність конструкту?Найскладніше запитання у вимірюванні: чи існує те, що ви вимірюєте, так, як ви це визначили, і чи ваш інструмент досягає саме його, а не чогось суміжного.
- Конвергентна та дискримінантна валідністьДві дзеркальні вимоги: вимір має узгоджуватися з тим, з чим має узгоджуватися, і має залишатися відмінним від того, чим він заявляє, що не є. Більшість слабких інструментів не виконують другу вимогу.
- Що таке альфа Кронбаха і чим вона не єНайчастіше повідомлювана статистика в психологічному тестуванні і та, яку найчастіше неправильно тлумачать. Альфа не говорить вам, що шкала є одновимірною, а високе значення часто є радше симптомом, ніж перевагою.
- Стандартна похибка вимірювання: наскільки ваш бал може відхилятисяКожен бал має похибку вимірювання, і для більшості психологічних тестів вона ширша, ніж ви припускаєте. Саме це число показує, коли різниця є реальною, а коли це шум.
- Норми та процентилі: з чим порівнюється ваш балСирий бал сам по собі не піддається інтерпретації. Він набуває значення лише у порівнянні з референтною групою, і те, яка саме група була використана, є одним із найважливіших і найменш розголошуваних фактів про будь-який тест.
- Як насправді створюється психометричний тестВід визначення конструкту до опублікованих норм послідовність триває роки і відсіює більшу частину того, з чого вона починалася. Знання цих етапів робить очевидним, які з них пропустив швидкий онлайн-тест.
- Що означає, коли тест називають валідизованим?Це слово не регулюється і вільно використовується продуктами, які не виконали жодної роботи. Ось що воно означає, коли воно щось означає, і чотири запитання, які розрізняють ці два випадки.
- Чому більшість особистісних тестів в інтернеті не є надійнимиНе тому, що вони нечесні, а тому, що кроки, які роблять вимірювання надійним, непомітні, дорогі, і їх легко пропустити. Їх пропуск жодним чином не змінює вигляд результату.
- Що самозвіт може і не може вимірюватиОпитувальники пропонують вам бути спостерігачем себе, що працює краще для одних речей, ніж для інших. Розуміння того, де метод сильний, а де він не спрацьовує, змінює те, як ви читаєте будь-який результат.
- Що означає, коли тест щось прогнозуєКореляція 0.30 є сильним результатом у дослідженнях особистості та слабкою підставою для рішення щодо однієї людини. Обидва твердження правдиві, і розрив між ними спричиняє більшість випадків неправильного використання результатів тестів.
- Скринінг не є діагнозомСкринінговий опитувальник створений для виявлення якомога більшої кількості можливих випадків, приймаючи високу частоту хибнопозитивних результатів як ціну. Тлумачення скринінгового бала як діагнозу спотворює те, для чого він був створений.