Чому більшість особистісних тестів в інтернеті не є надійними
Не тому, що вони нечесні, а тому, що кроки, які роблять вимірювання надійним, непомітні, дорогі, і їх легко пропустити. Їх пропуск жодним чином не змінює вигляд результату.
Безкоштовний онлайн-тест особистості та валідований психометричний інструмент дають результат, який виглядає однаково: бал, процентиль, абзац з вашим описом. Уся різниця полягає в роботі, якої не видно з екрана результатів.
Тут варто бути точними, бо звичне твердження, що інтернет-тести є шахрайством, здебільшого хибне й не надто корисне. Більшість із них створюють люди, які не мають наміру вводити в оману. Вони ненадійні зі структурних причин.
Що зазвичай пропускають
Аналіз пунктів. Під час належної розробки шкали більшість написаних пунктів відкидають після пілотування: пункти, за якими люди не відрізняються; пункти, що слабко корелюють із загальним балом; пункти з навантаженням на більш ніж один фактор; пункти, які поводяться по-різному в різних вікових чи мовних групах. Тест, написаний і опублікований без пілотування, зберіг усе, зокрема й пункти, які не працюють.
Незалежне підтвердження структури. Факторний аналіз на тих самих даних, на яких будували шкалу, відтворить закладену вами структуру. Підтвердження на новій вибірці є окремим дослідженням, і саме на цьому етапі значна частка шкал не проходить перевірку.
Норми. Процентиль має звідкись братися. Якщо сайт не вказує своєї референтної групи, число отримано або з даних попередніх відвідувачів, тобто самовідібраної групи невідомого складу, або взагалі нізвідки.
Дані повторного тестування. Щоб довести, що люди наступного місяця отримають той самий бал, їх потрібно знайти знову. Майже ніхто цього не робить, а отже, стабільність, яку передбачає слово «риса», не доведено.
Стимули розробки спрямовані не туди
Тест, створений заради залученості, оптимізовано під інший результат, ніж тест, створений заради точності, і ці цілі розходяться передбачуваним чином.
Улесливі результати працюють краще. Результатом, який повідомляє вам щось неприємне, діляться рідше, тож результати поступово зміщуються до описів, у яких кожен упізнає себе. Це ефект Барнума, продемонстрований у 1940-х роках і відтоді надійно відтворюваний: люди оцінюють загальні описи особистості як дуже точні саме щодо себе.
Типи працюють краще, ніж виміри. «Ви Архітектор» легше поширити, ніж «ви на 68-му процентилі за відкритістю з широким довірчим інтервалом». Типи також приховують похибку вимірювання, адже людина, яка на один бал по той чи інший бік від межі категорії, отримує зовсім різні ярлики.
Короткий тест працює краще, ніж достатній. Кожне додаткове запитання відсіює респондентів, тож тести скорочують до довжини, яка максимізує завершення, а не до тієї, що охоплює конструкт.
Ніщо з цього не є брехнею. Це оптимізація під показник, відмінний від точності.
Як розпізнати приблизно за тридцять секунд
Шукайте назву вихідного інструмента з авторами та роком. Шукайте вказівку на те, з якої групи взято норми. Шукайте будь-яке визнання обмежень чи похибки вимірювання. Зверніть увагу, чи є результат неперервним балом чи категорією. Перевірте, чи не обіцяє та сама сторінка визначити вашу ідеальну кар'єру, партнера чи життєве призначення за двадцятьма запитаннями.
Тест, який називає свій інструмент, посилається на джерело, вказує норми й повідомляє, чого він не може вам сказати, виконав цю роботу. Тест, який нічого з цього не робить, може бути приємним способом провести п'ять хвилин, але число, яке він видає, є лише прикрасою.
Для кожного інструмента в каталозі NOESIS зазначено, який опублікований тест він реалізує, хто його автор, у якому році його створено, як підраховуються бали і чого його результати не доводять. Саме останнє варто порівнювати.
Перевірте себе
Читати про вимірювання одне. Побачити власний бал із зазначенням джерела, нормативної вибірки та обмежень зовсім інше. Безкоштовно, без реєстрації.
Читати далі
- Що таке психометрика?Дисципліна, яка визначає, чи якісним є психологічне вимірювання, і причина, чому два тести зі схожими запитаннями можуть надзвичайно різнитися за цінністю своїх результатів.
- Що таке надійність у психологічному тестуванні?Надійність це узгодженість вимірювання, а не правильність. Тест може мати високу надійність і все одно вимірювати не те. Саме тому це перше запитання, яке ставлять, але ніколи не останнє.
- Що таке валідність у психологічному тестуванні?Валідність це не властивість, яку має тест. Це аргумент про те, чи є конкретна інтерпретація конкретного бала для конкретної мети обґрунтованою, і його потрібно заново вибудовувати для кожного нового застосування.
- Що таке валідність конструкту?Найскладніше запитання у вимірюванні: чи існує те, що ви вимірюєте, так, як ви це визначили, і чи ваш інструмент досягає саме його, а не чогось суміжного.
- Конвергентна та дискримінантна валідністьДві дзеркальні вимоги: вимір має узгоджуватися з тим, з чим має узгоджуватися, і має залишатися відмінним від того, чим він заявляє, що не є. Більшість слабких інструментів не виконують другу вимогу.
- Що таке альфа Кронбаха і чим вона не єНайчастіше повідомлювана статистика в психологічному тестуванні і та, яку найчастіше неправильно тлумачать. Альфа не говорить вам, що шкала є одновимірною, а високе значення часто є радше симптомом, ніж перевагою.
- Стандартна похибка вимірювання: наскільки ваш бал може відхилятисяКожен бал має похибку вимірювання, і для більшості психологічних тестів вона ширша, ніж ви припускаєте. Саме це число показує, коли різниця є реальною, а коли це шум.
- Норми та процентилі: з чим порівнюється ваш балСирий бал сам по собі не піддається інтерпретації. Він набуває значення лише у порівнянні з референтною групою, і те, яка саме група була використана, є одним із найважливіших і найменш розголошуваних фактів про будь-який тест.
- Як насправді створюється психометричний тестВід визначення конструкту до опублікованих норм послідовність триває роки і відсіює більшу частину того, з чого вона починалася. Знання цих етапів робить очевидним, які з них пропустив швидкий онлайн-тест.
- Що означає, коли тест називають валідизованим?Це слово не регулюється і вільно використовується продуктами, які не виконали жодної роботи. Ось що воно означає, коли воно щось означає, і чотири запитання, які розрізняють ці два випадки.
- Що самозвіт може і не може вимірюватиОпитувальники пропонують вам бути спостерігачем себе, що працює краще для одних речей, ніж для інших. Розуміння того, де метод сильний, а де він не спрацьовує, змінює те, як ви читаєте будь-який результат.
- Що означає, коли тест щось прогнозуєКореляція 0.30 є сильним результатом у дослідженнях особистості та слабкою підставою для рішення щодо однієї людини. Обидва твердження правдиві, і розрив між ними спричиняє більшість випадків неправильного використання результатів тестів.
- Скринінг не є діагнозомСкринінговий опитувальник створений для виявлення якомога більшої кількості можливих випадків, приймаючи високу частоту хибнопозитивних результатів як ціну. Тлумачення скринінгового бала як діагнозу спотворює те, для чого він був створений.