Як насправді створюється психометричний тест
Від визначення конструкту до опублікованих норм послідовність триває роки і відсіює більшу частину того, з чого вона починалася. Знання цих етапів робить очевидним, які з них пропустив швидкий онлайн-тест.
Психометричний інструмент, який доходить до публікації, зазвичай проходить п'ять чи шість років роботи, під час якої більшу частину написаного відкидають. Цю послідовність варто знати, бо кожен її етап відповідає способу, у який тест може бути недосконалим.
1. Визначте конструкт
Перш ніж буде написано будь-який пункт, конструкт потрібно визначити настільки точно, щоб можна було сказати, що виходить за його межі. Це означає визначення, опис вимірної структури: один вимір чи декілька, а якщо декілька, то як вони пов'язані, а також чітке пояснення, від яких суміжних конструктів він має відрізнятися.
Пропуск цього етапу є причиною появи більшості надлишкових інструментів. Шкала, побудована на інтуїтивному розумінні поняття, зазвичай зрештою вимірює усталену рису під новою назвою.
2. Створіть пул пунктів
Пунктів складають значно більше, ніж залишиться, зазвичай у три-п'ять разів більше за остаточну кількість. Вони походять з теорії, з наявних інструментів, з інтерв'ю з людьми, які мають описуваний досвід, а також від профільних експертів.
На цьому етапі пул перевіряють на повноту охоплення змісту (чи він охоплює весь конструкт, чи зосереджений на одному аспекті?), на рівень читабельності, на формулювання з подвійним змістом, а також на пункти, які насправді запитують про щось інше.
3. Пілотне дослідження та відсів
Пул передають першій вибірці. Аналіз здебільшого має руйнівний характер.
Пункти майже без дисперсії відкидають: запитання, на яке всі відповідають однаково, нікого не розрізняє. Пункти, що слабко корелюють із загальним балом, відкидають. Пункти, що мають перехресні навантаження більш ніж на один фактор, відкидають. Пункти, що працюють по-різному в різних демографічних групах з причин, не пов'язаних з рисою, тобто диференційне функціонування пунктів, відкидають, і ця перевірка є однією з тих, які пропускають найчастіше.
Те, що залишається, зазвичай становить третину від написаного.
4. Підтвердіть структуру на новій вибірці
Це крок, який відрізняє серйозні інструменти від решти. Факторний аналіз на вибірці розробки відтворить закладену структуру: він мусить це зробити, оскільки пункти добирали саме для цього. Справжньою перевіркою є конфірматорний факторний аналіз на незалежній вибірці.
Дуже багато опублікованих шкал відтворюють заплановану структуру лише на даних, використаних для їх побудови. Коли хтось інший збирає нові дані, фактори не з'являються. Така невдача настільки поширена, що запитання «чи була структура підтверджена на незалежній вибірці?» є одним із найефективніших запитань щодо будь-якого інструмента.
5. Накопичуйте докази валідності
Кореляції з усталеними показниками того самого конструкту. Кореляції з конструктами, від яких він має відрізнятися, які мають бути нижчими. Зв'язки з важливими результатами. Інкрементна валідність порівняно з тим, що вже існує. Стабільність ретестових показників за інтервал, що відповідає конструкту.
Цей етап не завершується. Він триває, доки інструмент використовують, і саме на ньому в інструментах найчастіше виявляють недоліки через роки після публікації.
6. Побудуйте норми
Референтна вибірка, достатньо велика та репрезентативна для цільової популяції, стратифікована там, де риса варіює за віком чи статтю, із зазначенням року та країни. Потім її періодично повторюють, бо норми зміщуються.
7. Адаптуйте, якщо інструмент використовуватимуть в іншому місці
Переклад не є лінгвістичною вправою. Належна адаптація означає прямий переклад, незалежний зворотний переклад, експертну перевірку, когнітивні інтерв'ю з носіями цільової мови, а потім нове психометричне дослідження новою мовою, щоб перевірити, чи зберігається структура і чи пункти функціонують еквівалентно. Інструмент, перекладений без такого дослідження, є неперевіреним інструментом цією мовою, якими б не були його заслуги в оригіналі.
Що це означає для швидкого опитувальника
Тест, написаний за один вечір, завершив другий крок. Він цілком може дати правдоподібний на вигляд результат, процентиль та абзац опису. Пропущені ним кроки, це ті, які мали б встановити, чи означає щось із цього взагалі щось.
Перевірте себе
Читати про вимірювання одне. Побачити власний бал із зазначенням джерела, нормативної вибірки та обмежень зовсім інше. Безкоштовно, без реєстрації.
Читати далі
- Що таке психометрика?Дисципліна, яка визначає, чи якісним є психологічне вимірювання, і причина, чому два тести зі схожими запитаннями можуть надзвичайно різнитися за цінністю своїх результатів.
- Що таке надійність у психологічному тестуванні?Надійність це узгодженість вимірювання, а не правильність. Тест може мати високу надійність і все одно вимірювати не те. Саме тому це перше запитання, яке ставлять, але ніколи не останнє.
- Що таке валідність у психологічному тестуванні?Валідність це не властивість, яку має тест. Це аргумент про те, чи є конкретна інтерпретація конкретного бала для конкретної мети обґрунтованою, і його потрібно заново вибудовувати для кожного нового застосування.
- Що таке валідність конструкту?Найскладніше запитання у вимірюванні: чи існує те, що ви вимірюєте, так, як ви це визначили, і чи ваш інструмент досягає саме його, а не чогось суміжного.
- Конвергентна та дискримінантна валідністьДві дзеркальні вимоги: вимір має узгоджуватися з тим, з чим має узгоджуватися, і має залишатися відмінним від того, чим він заявляє, що не є. Більшість слабких інструментів не виконують другу вимогу.
- Що таке альфа Кронбаха і чим вона не єНайчастіше повідомлювана статистика в психологічному тестуванні і та, яку найчастіше неправильно тлумачать. Альфа не говорить вам, що шкала є одновимірною, а високе значення часто є радше симптомом, ніж перевагою.
- Стандартна похибка вимірювання: наскільки ваш бал може відхилятисяКожен бал має похибку вимірювання, і для більшості психологічних тестів вона ширша, ніж ви припускаєте. Саме це число показує, коли різниця є реальною, а коли це шум.
- Норми та процентилі: з чим порівнюється ваш балСирий бал сам по собі не піддається інтерпретації. Він набуває значення лише у порівнянні з референтною групою, і те, яка саме група була використана, є одним із найважливіших і найменш розголошуваних фактів про будь-який тест.
- Що означає, коли тест називають валідизованим?Це слово не регулюється і вільно використовується продуктами, які не виконали жодної роботи. Ось що воно означає, коли воно щось означає, і чотири запитання, які розрізняють ці два випадки.
- Чому більшість особистісних тестів в інтернеті не є надійнимиНе тому, що вони нечесні, а тому, що кроки, які роблять вимірювання надійним, непомітні, дорогі, і їх легко пропустити. Їх пропуск жодним чином не змінює вигляд результату.
- Що самозвіт може і не може вимірюватиОпитувальники пропонують вам бути спостерігачем себе, що працює краще для одних речей, ніж для інших. Розуміння того, де метод сильний, а де він не спрацьовує, змінює те, як ви читаєте будь-який результат.
- Що означає, коли тест щось прогнозуєКореляція 0.30 є сильним результатом у дослідженнях особистості та слабкою підставою для рішення щодо однієї людини. Обидва твердження правдиві, і розрив між ними спричиняє більшість випадків неправильного використання результатів тестів.
- Скринінг не є діагнозомСкринінговий опитувальник створений для виявлення якомога більшої кількості можливих випадків, приймаючи високу частоту хибнопозитивних результатів як ціну. Тлумачення скринінгового бала як діагнозу спотворює те, для чого він був створений.