Стандартна похибка вимірювання: наскільки ваш бал може відхилятися
Кожен бал має похибку вимірювання, і для більшості психологічних тестів вона ширша, ніж ви припускаєте. Саме це число показує, коли різниця є реальною, а коли це шум.
Стандартна похибка вимірювання перетворює абстрактний коефіцієнт надійності на щось конкретне: інтервал плюс-мінус навколо бала. Вона відповідає на запитання, яке більшість екранів з результатами залишає без відповіді: наскільки цей показник міг би відрізнятися, якби ви проходили тест іншого дня після обіду?
Формула проста. Помножте стандартне відхилення шкали на квадратний корінь з одиниці мінус її надійність. Для шкали зі стандартним відхиленням 10 і надійністю 0.85 стандартна похибка становить приблизно 3.9 бала.
Що цей інтервал насправді охоплює
Приблизно у двох третинах випадків істинне значення людини знаходиться в межах однієї стандартної похибки від її спостережуваного бала. Щоб бути впевненими приблизно на 95 відсотків, потрібно приблизно дві стандартні похибки в кожен бік.
Візьмімо наведений вище приклад. Людина набирає 62 бали. 95-відсотковий інтервал триває приблизно від 54 до 70. Це вікно у шістнадцять балів на шкалі, де типовий розрив між середнім рівнем і явно вищим за середній може становити десять балів.
Це не недолік саме цього тесту. Надійність 0.85 є пристойною. Це нормальна точність психологічного вимірювання, і саме тому ретельні звіти подають інтервали, а не точкові значення.
Наслідки, які люди не помічають
Невеликі відмінності між шкалами зазвичай нічого не означають. Якщо ваша екстраверсія становить 58, а відкритість 54, чесний висновок полягає в тому, що їх неможливо розрізнити. Інтерпретації профілю, які будують розповідь на розривах у чотири бали, зчитують шум.
Невеликі зміни з часом зазвичай теж нічого не означають. Повторне проходження тесту зі зміною на п'ять балів знаходиться в межах похибки для більшості інструментів. Справжня зміна рис відбувається протягом років і проявляється як зсув значно за межі смуги похибки, а не як кілька балів від місяця до місяця.
Ранжування посилює проблему. Різниця в кілька сирих балів може перемістити людину на десять процентильних місць у щільній середині розподілу, оскільки саме там знаходиться більшість людей. Процентильні ранги виглядають точними, хоча це найменш стабільний спосіб вираження бала.
Точність не є однаковою вздовж шкали. Класична теорія тестів припускає одне значення похибки для кожного бала, що є спрощенням. Теорія відповіді на завдання моделює похибку окремо для кожного рівня риси, і вона майже завжди більша на крайніх значеннях, саме там, де робляться найбільш відповідальні інтерпретації. Дуже високий або дуже низький бал зазвичай є менш точним, ніж середній, а не більш точним.
Чому чесне звітування виглядає менш вражаюче
Інструмент, який повідомляє довірчі інтервали, виглядає менш визначеним, ніж той, що повідомляє одне число з одним знаком після коми. Менш визначений говорить правду. Той, що виглядає точним, має ту саму базову похибку і вирішив її не показувати.
Про це варто пам'ятати, порівнюючи науково задокументований тест із комерційним продуктом, який відносить вас до певної категорії. Межа категорії проходить за конкретним балом, а людина на один бал нижче неї і людина на один бал вище неї, статистично, є тією самою людиною. Ярлик типу це повністю приховує, що є одним із серйозніших аргументів проти інструментів, заснованих на типах, і причиною, чому неперервні бали із зазначеною похибкою є стандартом у дослідженнях.
Перевірте себе
Читати про вимірювання одне. Побачити власний бал із зазначенням джерела, нормативної вибірки та обмежень зовсім інше. Безкоштовно, без реєстрації.
Читати далі
- Що таке психометрика?Дисципліна, яка визначає, чи якісним є психологічне вимірювання, і причина, чому два тести зі схожими запитаннями можуть надзвичайно різнитися за цінністю своїх результатів.
- Що таке надійність у психологічному тестуванні?Надійність це узгодженість вимірювання, а не правильність. Тест може мати високу надійність і все одно вимірювати не те. Саме тому це перше запитання, яке ставлять, але ніколи не останнє.
- Що таке валідність у психологічному тестуванні?Валідність це не властивість, яку має тест. Це аргумент про те, чи є конкретна інтерпретація конкретного бала для конкретної мети обґрунтованою, і його потрібно заново вибудовувати для кожного нового застосування.
- Що таке валідність конструкту?Найскладніше запитання у вимірюванні: чи існує те, що ви вимірюєте, так, як ви це визначили, і чи ваш інструмент досягає саме його, а не чогось суміжного.
- Конвергентна та дискримінантна валідністьДві дзеркальні вимоги: вимір має узгоджуватися з тим, з чим має узгоджуватися, і має залишатися відмінним від того, чим він заявляє, що не є. Більшість слабких інструментів не виконують другу вимогу.
- Що таке альфа Кронбаха і чим вона не єНайчастіше повідомлювана статистика в психологічному тестуванні і та, яку найчастіше неправильно тлумачать. Альфа не говорить вам, що шкала є одновимірною, а високе значення часто є радше симптомом, ніж перевагою.
- Норми та процентилі: з чим порівнюється ваш балСирий бал сам по собі не піддається інтерпретації. Він набуває значення лише у порівнянні з референтною групою, і те, яка саме група була використана, є одним із найважливіших і найменш розголошуваних фактів про будь-який тест.
- Як насправді створюється психометричний тестВід визначення конструкту до опублікованих норм послідовність триває роки і відсіює більшу частину того, з чого вона починалася. Знання цих етапів робить очевидним, які з них пропустив швидкий онлайн-тест.
- Що означає, коли тест називають валідизованим?Це слово не регулюється і вільно використовується продуктами, які не виконали жодної роботи. Ось що воно означає, коли воно щось означає, і чотири запитання, які розрізняють ці два випадки.
- Чому більшість особистісних тестів в інтернеті не є надійнимиНе тому, що вони нечесні, а тому, що кроки, які роблять вимірювання надійним, непомітні, дорогі, і їх легко пропустити. Їх пропуск жодним чином не змінює вигляд результату.
- Що самозвіт може і не може вимірюватиОпитувальники пропонують вам бути спостерігачем себе, що працює краще для одних речей, ніж для інших. Розуміння того, де метод сильний, а де він не спрацьовує, змінює те, як ви читаєте будь-який результат.
- Що означає, коли тест щось прогнозуєКореляція 0.30 є сильним результатом у дослідженнях особистості та слабкою підставою для рішення щодо однієї людини. Обидва твердження правдиві, і розрив між ними спричиняє більшість випадків неправильного використання результатів тестів.
- Скринінг не є діагнозомСкринінговий опитувальник створений для виявлення якомога більшої кількості можливих випадків, приймаючи високу частоту хибнопозитивних результатів як ціну. Тлумачення скринінгового бала як діагнозу спотворює те, для чого він був створений.