Конвергентна та дискримінантна валідність
Дві дзеркальні вимоги: вимір має узгоджуватися з тим, з чим має узгоджуватися, і має залишатися відмінним від того, чим він заявляє, що не є. Більшість слабких інструментів не виконують другу вимогу.
Конвергентна та дискримінантна валідність це дві половини єдиної вимоги. Показник має корелювати з тим, з чим теоретично повинен, і не повинен корелювати надто високо з тим, від чого, як стверджується, він відрізняється. Виконання однієї умови без іншої це не частковий успіх, це зазвичай ознака того, що конструкт не є тим, за що себе видає.
Конвергентна валідність
Конвергентні докази показують, що показник узгоджується з іншими індикаторами того самого явища. Нова шкала тривожності повинна суттєво корелювати з усталеними шкалами тривожності, з оцінками клініцистів і, в ідеалі, з чимось, що не є іншим опитувальником, наприклад з фізіологічними показниками або спостережуваною поведінкою уникнення.
Кореляції тут зазвичай очікуються вище 0.50, часто вище 0.70, коли показник для порівняння є добре усталеним інструментом для того самого конструкту. Нижче цього рівня або нова шкала, або показник для порівняння вимірює щось інше.
Тут є пастка. Кореляція 0.95 з наявною шкалою це не тріумф, це означає, що новий інструмент є перепакуванням, і чесним запитанням стає те, що він додає. Конвергентна валідність це мінімальний рівень, а не мета, яку треба максимізувати.
Дискримінантна валідність
Дискримінантні докази показують, що показник залишається відокремленим від конструктів, від яких він, за твердженням, відрізняється. Саме тут трапляються цікаві невдачі.
Цей шаблон повторюється в літературі. Наполегливість корелює приблизно на рівні 0.84 із сумлінністю, настільки близько, що метааналіз показав: вона майже нічого не додає до прогнозування академічної успішності, коли сумлінність контролюється. Самозвітний емоційний інтелект значною мірою перетинається з емоційною стабільністю, екстраверсією та сумлінністю разом узятими. Спільна дисперсія в межах Темної тріади значною мірою зникає, коли враховується Чесність-Скромність з моделі HEXACO. У кожному випадку конструкт подавався як нова територія, а виявився перейменованою ділянкою наявної карти.
Дискримінантна валідність це також місце, де виявляються ефекти методу. Якщо кожен конструкт самозвіту в дослідженні корелює на рівні 0.4 з кожним іншим, спільним чинником, імовірно, є стиль відповідей респондента, а не будь-яка спільна психологія.
Тест, який це вирішує
Вирішальною процедурою є інкрементна валідність: спочатку введіть усталений показник у регресію, потім новий, і подивіться, чи пояснює новий додаткову дисперсію результату. Якщо ні, конструкт може й далі бути теоретично цікавим, але інструмент не вимірює нічого такого, чого в цій галузі ще не було.
Це вимогливий стандарт, і дуже багато опублікованих шкал ніколи йому не піддавалися. Коли їх йому піддають, результатом часто є наведене вище виявлення надмірності. Це не скандал, це нормальне наукове відсікання, але це означає, що популярність конструкту нічого не говорить про те, чи витримає він перевірку.
Що це змінює для читача
Коли тест повідомляє кілька балів, корисне запитання полягає в тому, чи ці бали справді відмінні. Чотири виміри, які корелюють на рівні 0.8 один з одним, це один вимір із чотирма назвами, а профіль, побудований на них, виглядатиме диференційованим, хоча нестиме майже незалежну інформацію.
Інструменти, які повідомляють свої міжшкальні кореляції, дозволяють вам перевірити це самостійно. Інструменти, які презентують тип із чотирьох квадрантів, але ніколи не показують, як квадранти пов'язані між собою, зробили таку перевірку неможливою, в чому зазвичай і полягає суть.
Перевірте себе
Читати про вимірювання одне. Побачити власний бал із зазначенням джерела, нормативної вибірки та обмежень зовсім інше. Безкоштовно, без реєстрації.
Читати далі
- Що таке психометрика?Дисципліна, яка визначає, чи якісним є психологічне вимірювання, і причина, чому два тести зі схожими запитаннями можуть надзвичайно різнитися за цінністю своїх результатів.
- Що таке надійність у психологічному тестуванні?Надійність це узгодженість вимірювання, а не правильність. Тест може мати високу надійність і все одно вимірювати не те. Саме тому це перше запитання, яке ставлять, але ніколи не останнє.
- Що таке валідність у психологічному тестуванні?Валідність це не властивість, яку має тест. Це аргумент про те, чи є конкретна інтерпретація конкретного бала для конкретної мети обґрунтованою, і його потрібно заново вибудовувати для кожного нового застосування.
- Що таке валідність конструкту?Найскладніше запитання у вимірюванні: чи існує те, що ви вимірюєте, так, як ви це визначили, і чи ваш інструмент досягає саме його, а не чогось суміжного.
- Що таке альфа Кронбаха і чим вона не єНайчастіше повідомлювана статистика в психологічному тестуванні і та, яку найчастіше неправильно тлумачать. Альфа не говорить вам, що шкала є одновимірною, а високе значення часто є радше симптомом, ніж перевагою.
- Стандартна похибка вимірювання: наскільки ваш бал може відхилятисяКожен бал має похибку вимірювання, і для більшості психологічних тестів вона ширша, ніж ви припускаєте. Саме це число показує, коли різниця є реальною, а коли це шум.
- Норми та процентилі: з чим порівнюється ваш балСирий бал сам по собі не піддається інтерпретації. Він набуває значення лише у порівнянні з референтною групою, і те, яка саме група була використана, є одним із найважливіших і найменш розголошуваних фактів про будь-який тест.
- Як насправді створюється психометричний тестВід визначення конструкту до опублікованих норм послідовність триває роки і відсіює більшу частину того, з чого вона починалася. Знання цих етапів робить очевидним, які з них пропустив швидкий онлайн-тест.
- Що означає, коли тест називають валідизованим?Це слово не регулюється і вільно використовується продуктами, які не виконали жодної роботи. Ось що воно означає, коли воно щось означає, і чотири запитання, які розрізняють ці два випадки.
- Чому більшість особистісних тестів в інтернеті не є надійнимиНе тому, що вони нечесні, а тому, що кроки, які роблять вимірювання надійним, непомітні, дорогі, і їх легко пропустити. Їх пропуск жодним чином не змінює вигляд результату.
- Що самозвіт може і не може вимірюватиОпитувальники пропонують вам бути спостерігачем себе, що працює краще для одних речей, ніж для інших. Розуміння того, де метод сильний, а де він не спрацьовує, змінює те, як ви читаєте будь-який результат.
- Що означає, коли тест щось прогнозуєКореляція 0.30 є сильним результатом у дослідженнях особистості та слабкою підставою для рішення щодо однієї людини. Обидва твердження правдиві, і розрив між ними спричиняє більшість випадків неправильного використання результатів тестів.
- Скринінг не є діагнозомСкринінговий опитувальник створений для виявлення якомога більшої кількості можливих випадків, приймаючи високу частоту хибнопозитивних результатів як ціну. Тлумачення скринінгового бала як діагнозу спотворює те, для чого він був створений.