Защо повечето интернет тестове за личността не са надеждни
Не защото са нечестни, а защото стъпките, които правят едно измерване надеждно, са невидими, скъпи и лесни за пропускане, а пропускането им не променя с нищо начина, по който изглежда резултатът.
Безплатният онлайн тест за личността и валидираният психометричен инструмент създават резултат, който изглежда идентичен: резултат, перцентил, абзац, който те описва. Разликата се състои изцяло в работата, която не можеш да видиш от екрана с резултатите.
Заслужава си да бъдем точни тук, защото обичайното схващане, че интернет тестовете са измама, е предимно погрешно и не много полезно. Повечето са създадени от хора без намерение да мамят. Те са ненадеждни по структурни причини.
Какво обикновено се пропуска
Анализ на твърденията. В правилно изградена скала повечето чернови на твърдения се отхвърлят след пилотно тестване: твърдения, по които никой не варира, твърдения, които корелират слабо с общия резултат, твърдения, които се натоварват на повече от един фактор, твърдения, които се държат различно при различни възрастови или езикови групи. Тест, написан и публикуван без пилотно изследване, е запазил всичко, включително твърденията, които не работят.
Независимо потвърждение на структурата. Факторният анализ на данните, от които си изградил скалата, ще възстанови структурата, която си проектирал. Потвърждаването ѝ в нова извадка е отделно проучване и това е стъпката, при която голяма част от скалите се провалят.
Норми. Перцентилът трябва да дойде отнякъде. Ако сайтът не посочва своята референтна популация, числото е изведено или от предишни посетители, самоселектирала се група с неизвестен състав, или от нищо конкретно.
Данни от тест-ретест. Установяването, че хората имат същия резултат следващия месец, изисква те да бъдат намерени отново. Почти никой не прави това, което означава, че стабилността, която думата "черта" предполага, не е демонстрирана.
Стимулите за дизайн работят в грешна посока
Тест, създаден за ангажиране, е оптимизиран за различен резултат от тест, създаден за точност, и двете се раздалечават по предвидими начини.
Ласкателните резултати се представят по-добре. Резултат, който ти казва нещо нежелано, се споделя по-малко, така че резултатите се изместват към описания, които всеки разпознава в себе си. Това е ефектът на Барнъм, демонстриран през 40-те години на 20-ти век и надеждно възпроизвеждан оттогава: хората оценяват общите описания на личността като изключително точни конкретно за тях самите.
Типовете се представят по-добре от измеренията. "Ти си Архитект" е по-вероятно да бъде споделено от "ти си на 68-ия перцентил по откритост с широк доверителен интервал". Типовете също така прикриват грешката на измерване, тъй като някой, който е на един пункт от която и да е страна на границата на категорията, получава напълно различни етикети.
Краткото се представя по-добре от адекватното. Всеки допълнителен въпрос губи респонденти, така че тестовете се съкращават до дължина, която максимизира завършването, а не до такава, която покрива конструкта.
Нито едно от тези неща не е лъжа. Те са оптимизация за метрика, различна от точността.
Как да разбереш за около тридесет секунди
Търси назован изходен инструмент с автори и година. Търси изявление за това от каква популация идват нормите. Търси каквото и да е признание за ограничения или грешка на измерване. Търси дали резултатът е непрекъсната стойност, или категория. Търси дали същата страница също обещава да идентифицира твоята идеална кариера, партньор или цел в живота от двадесет въпроса.
Тест, който назовава своя инструмент, цитира източника си, посочва нормите си и казва какво не може да ти каже, си е свършил работата. Такъв, който не прави нищо от това, все още може да бъде приятен начин да прекараш пет минути, но числото, което създава, е просто декорация.
Всеки инструмент в каталога на NOESIS посочва кой публикуван тест прилага, кой го е написал, през коя година, как се изчислява резултатът му и какво не установяват резултатите от него. Точно тази последна част си струва да бъде използвана за сравнение.
Подложи го на тест
Четенето за измерванията е едно. Да видиш собствения си резултат с неговия източник, извадка за норма и ограничения е съвсем друго. Безплатен за попълване, не се изисква регистрация.
Продължи да четеш
- Какво е психометрия?Дисциплината, която установява дали дадено психологическо измерване е добро, и причината два теста, задаващи подобни въпроси, да се различават изключително много по стойността на своите резултати.
- Какво е надеждност в психологическото тестване?Надеждността е съгласуваност на измерването, а не точност. Един тест може да бъде много надежден и въпреки това да измерва грешното нещо, поради което това е първият зададен въпрос, но никога последният.
- Какво е валидност в психологическото тестване?Валидността не е свойство, което един тест притежава. Тя е аргумент за това дали определена интерпретация на даден резултат за определена цел е защитима и трябва да се изгражда наново за всяка нова употреба.
- Какво е конструктна валидност?Най-трудният въпрос при измерването: дали нещото, което измерваш, съществува така, както си го дефинирал, и дали твоят инструмент достига до него, а не до нещо сходно.
- Конвергентна и дискриминантна валидностДве огледални изисквания: един измерител трябва да съответства на това, на което трябва да съответства, и трябва да остане разграничим от това, което твърди, че не е. Повечето слаби инструменти се провалят на второто.
- Какво е алфа на Кронбах и какво не еНай-често отчитаната статистика в психологическото тестване и най-погрешно тълкуваната. Алфа не ти казва, че дадена скала е едноизмерна, а високата стойност често е по-скоро симптом, отколкото предимство.
- Стандартна грешка на измерването: с колко може да се отклонява твоят резултатВсеки резултат съдържа допустима грешка, а при повечето психологически тестове тя е по-голяма, отколкото хората предполагат. Това е числото, което ти показва кога една разлика е реална и кога е шум.
- Норми и перцентили: с какво се сравнява твоят резултатСуровият резултат не може да се интерпретира сам по себе си. Той придобива смисъл само спрямо референтна група, а коя група е използвана, е един от най-важните и най-слабо огласявани факти за всеки тест.
- Как всъщност се създава един психометричен тестОт дефинирането на конструкта до публикуваните норми, процесът отнема години и отхвърля по-голямата част от това, което е вложено в него. Ако познаваш стъпките, става очевидно кои от тях са пропуснати при един бърз онлайн тест.
- Какво означава, когато един тест се нарича валидиран?Думата е нерегулирана и се използва свободно от продукти, които не са положили нужните усилия. Ето какво означава тя, когато наистина има смисъл, и четирите въпроса, които разграничават двата случая.
- Какво може и какво не може да измери една самооценкаВъпросниците изискват от теб да бъдеш наблюдател на самия себе си, което работи по-добре за някои неща, отколкото за други. Да знаеш къде методът е силен и къде се проваля, променя начина, по който четеш всеки резултат.
- Какво означава, когато един тест предсказва нещоКорелация от 0,30 е силно откритие в изследванията на личността и слаба основа за решение за един човек. И двете твърдения са верни, а разминаването между тях причинява повечето злоупотреби с резултатите от тестовете.
- Скринингът не е диагнозаСкрининговият въпросник е създаден, за да улови възможно най-много потенциални случаи, приемайки висок процент на фалшиво положителни резултати като цена за това. Интерпретирането на скринингов резултат като диагноза противоречи на целта, за която е създаден.