Що таке валідність у психологічному тестуванні?
Валідність це не властивість, яку має тест. Це аргумент про те, чи є конкретна інтерпретація конкретного бала для конкретної мети обґрунтованою, і його потрібно заново вибудовувати для кожного нового застосування.
Валідність ставить питання, чи вимірює тест те, що він заявляє, і чи є обґрунтованими висновки, які люди роблять на основі його балів. Це центральне питання психометрики і те, на яке найчастіше відповідають маркетинговим твердженням, а не доказами.
Сучасне розуміння, яке утвердилося з часів праць Мессіка у 1980-х роках, полягає в тому, що валідність не є фіксованою властивістю інструмента. Це властивість інтерпретації балів для конкретного застосування. Один і той самий опитувальник може бути добре валідизованим для опису самосприйняття людини і зовсім не валідизованим для вирішення питання про її найм. Твердження «цей тест валідний» без уточнення, валідний для чого, це не твердження, це гасло.
Види доказів
Валідність будується на накопичених доказах кількох типів. У давніших текстах їх подають як окремі види валідності; сучасний погляд розглядає їх як різні аргументи на підтримку одного загального обґрунтування.
Змістові докази стосуються того, чи пункти належно охоплюють конструкт. Шкала депресії, яка запитує лише про сон та апетит, охоплює соматичні симптоми і пропускає емоційні та когнітивні. Змістове охоплення зазвичай оцінюють профільні експерти, і саме тому дуже короткі шкали завжди є компромісом.
Докази внутрішньої структури стосуються того, чи групуються пункти так, як це передбачає теорія. Якщо модель заявляє чотири окремі аспекти, факторний аналіз має відтворити чотири фактори, і що важливо, на незалежній вибірці, а не лише на тій, на якій шкалу було розроблено. Дуже багато інструментів відтворюють заявлену структуру на вибірці розробки і не відтворюють її на жодній іншій.
Зв'язки з іншими змінними, саме тут виконується більшість роботи. Конвергентні докази показують, що шкала корелює з тим, з чим вона має корелювати. Дискримінантні докази показують, що вона не корелює надто високо з тим, від чого вона має відрізнятися, хронічно занедбана вимога, через яку провалюється багато нових брендованих конструктів. Критеріальні докази показують, що бал пов'язаний із важливим результатом, виміряним одночасно або спрогнозованим заздалегідь.
Консеквенційні докази стосуються того, що відбувається, коли тест застосовують. Якщо інструмент систематично ставить певну групу в невигідне становище з причин, не пов'язаних із конструктом, це проблема валідності, а не лише етична проблема.
Питання, яке викриває більшість тверджень
Найгострішою перевіркою твердження про валідність є інкрементна валідність: чи додає цей інструмент щось понад те, що вже повідомляє дешевший, давніший, усталений показник?
Примітно багато брендованих конструктів провалюються саме тут. Вони корелюють на рівні 0.7 або вище з наявним доменом Великої п'ятірки, прогнозують ті самі результати з тією самою силою і нічого не додають, коли давніший показник статистично контролюють. Конструкт новий, а вимірювання ні. Саме тому розділи з критикою в серйозній документації інструментів так часто зосереджені на надмірності, а не на неточності.
На що вам варто звернути увагу
Коли хтось стверджує, що тест валідизовано, корисні питання є конкретними. Валідизовано відносно якого критерію? На якій популяції і якого обсягу? Чи була підтверджена факторна структура на незалежній вибірці? Чи існують опубліковані докази від дослідників без комерційної зацікавленості в результаті? Чи додає він щось порівняно з усталеною альтернативою?
Інструмент із чесними відповідями на ці питання варто сприймати серйозно, включно з його обмеженнями. Інструмент, чия валідизація складається зі сторінки відгуків і твердження, що його пройшли мільйони людей, відповідає на зовсім інше питання: популярність не є доказом, а кількість людей, які пройшли тест, нічого не говорить про те, чи означають його бали щось.
Перевірте себе
Читати про вимірювання одне. Побачити власний бал із зазначенням джерела, нормативної вибірки та обмежень зовсім інше. Безкоштовно, без реєстрації.
Читати далі
- Що таке психометрика?Дисципліна, яка визначає, чи якісним є психологічне вимірювання, і причина, чому два тести зі схожими запитаннями можуть надзвичайно різнитися за цінністю своїх результатів.
- Що таке надійність у психологічному тестуванні?Надійність це узгодженість вимірювання, а не правильність. Тест може мати високу надійність і все одно вимірювати не те. Саме тому це перше запитання, яке ставлять, але ніколи не останнє.
- Що таке валідність конструкту?Найскладніше запитання у вимірюванні: чи існує те, що ви вимірюєте, так, як ви це визначили, і чи ваш інструмент досягає саме його, а не чогось суміжного.
- Конвергентна та дискримінантна валідністьДві дзеркальні вимоги: вимір має узгоджуватися з тим, з чим має узгоджуватися, і має залишатися відмінним від того, чим він заявляє, що не є. Більшість слабких інструментів не виконують другу вимогу.
- Що таке альфа Кронбаха і чим вона не єНайчастіше повідомлювана статистика в психологічному тестуванні і та, яку найчастіше неправильно тлумачать. Альфа не говорить вам, що шкала є одновимірною, а високе значення часто є радше симптомом, ніж перевагою.
- Стандартна похибка вимірювання: наскільки ваш бал може відхилятисяКожен бал має похибку вимірювання, і для більшості психологічних тестів вона ширша, ніж ви припускаєте. Саме це число показує, коли різниця є реальною, а коли це шум.
- Норми та процентилі: з чим порівнюється ваш балСирий бал сам по собі не піддається інтерпретації. Він набуває значення лише у порівнянні з референтною групою, і те, яка саме група була використана, є одним із найважливіших і найменш розголошуваних фактів про будь-який тест.
- Як насправді створюється психометричний тестВід визначення конструкту до опублікованих норм послідовність триває роки і відсіює більшу частину того, з чого вона починалася. Знання цих етапів робить очевидним, які з них пропустив швидкий онлайн-тест.
- Що означає, коли тест називають валідизованим?Це слово не регулюється і вільно використовується продуктами, які не виконали жодної роботи. Ось що воно означає, коли воно щось означає, і чотири запитання, які розрізняють ці два випадки.
- Чому більшість особистісних тестів в інтернеті не є надійнимиНе тому, що вони нечесні, а тому, що кроки, які роблять вимірювання надійним, непомітні, дорогі, і їх легко пропустити. Їх пропуск жодним чином не змінює вигляд результату.
- Що самозвіт може і не може вимірюватиОпитувальники пропонують вам бути спостерігачем себе, що працює краще для одних речей, ніж для інших. Розуміння того, де метод сильний, а де він не спрацьовує, змінює те, як ви читаєте будь-який результат.
- Що означає, коли тест щось прогнозуєКореляція 0.30 є сильним результатом у дослідженнях особистості та слабкою підставою для рішення щодо однієї людини. Обидва твердження правдиві, і розрив між ними спричиняє більшість випадків неправильного використання результатів тестів.
- Скринінг не є діагнозомСкринінговий опитувальник створений для виявлення якомога більшої кількості можливих випадків, приймаючи високу частоту хибнопозитивних результатів як ціну. Тлумачення скринінгового бала як діагнозу спотворює те, для чого він був створений.