Какво е валидност в психологическото тестване?
Валидността не е свойство, което един тест притежава. Тя е аргумент за това дали определена интерпретация на даден резултат за определена цел е защитима и трябва да се изгражда наново за всяка нова употреба.
Валидността задава въпроса дали един тест измерва това, което твърди, че измерва, и дали заключенията, които хората правят от неговите резултати, са основателни. Това е централният въпрос в психометрията и този, на който най-често се отговаря с маркетингово твърдение, а не с доказателства.
Съвременното разбиране, което се е запазило от работата на Messick през 80-те години на миналия век, е, че валидността не е фиксиран атрибут на един инструмент. Тя е свойство на дадена интерпретация на резултатите за специфична употреба. Същият въпросник може да бъде добре валидиран за описване на самооценката на даден човек и напълно невалидиран за вземане на решение дали той да бъде нает на работа. Да се каже "този тест е валиден", без да се каже за какво е валиден, не е твърдение; това е лозунг.
Видове доказателства
Валидността се изгражда от натрупани доказателства от няколко вида. По-старите текстове ги представят като отделни видове валидност; настоящото виждане ги разглежда като различни аргументи, подкрепящи един и същ случай.
Доказателствата за съдържанието задават въпроса дали твърденията покриват дадения конструкт правилно. Една скала за депресия, която задава въпроси само за съня и апетита, покрива соматичните симптоми и пропуска тези, свързани с настроението и познанието. Покритието на съдържанието обикновено се оценява от експерти в съответната област и това е причината много кратките скали винаги да са компромис.
Доказателствата за вътрешната структура задават въпроса дали твърденията се групират по начина, по който теорията твърди, че трябва да го правят. Ако един модел твърди, че има четири отделни аспекта, факторният анализ трябва да установи четири фактора, и което е изключително важно, в независима извадка, а не само в тази, въз основа на която е създадена скалата. Много голям брой инструменти възстановяват предвидената си структура в извадката за разработка и се провалят в тази на всеки друг.
Връзките с други променливи са мястото, където се извършва по-голямата част от работата. Конвергентните доказателства показват, че дадената скала корелира с нещата, с които трябва да корелира. Дискриминантните доказателства показват, че тя не корелира твърде силно с нещата, от които трябва да се различава. Това е хронично пренебрегвано изискване и това, което проваля много новосъздадени конструкти. Критериалните доказателства показват, че резултатът е свързан с важен изход, който е измерен по същото време или е прогнозиран предварително.
Доказателствата за последствията задават въпроса какво се случва, когато се използва даденият тест. Ако един инструмент систематично поставя в неблагоприятно положение дадена група по причини, които не са свързани с конструкта, това е проблем на валидността, а не просто етичен такъв.
Въпросът, който разобличава повечето твърдения
Най-острият тест за твърдение за валидност е инкременталната валидност: добавя ли този инструмент нещо към това, което един по-евтин, по-стар и утвърден метод вече ти казва?
Забележителен брой брандирани конструкти се провалят тук. Те корелират 0,7 или повече със съществуваща област от Big Five, прогнозират същите изходи със същата величина и не добавят нищо, след като по-старата мярка бъде статистически контролирана. Конструктът е нов; измерването не е. Ето защо разделите с критики в сериозната документация на инструментите толкова често се съсредоточават върху излишността, а не върху неточността.
Какво да търсиш
Когато някой твърди, че един тест е валидиран, полезните въпроси са конкретни. Валидиран спрямо какъв критерий? В коя популация и с какъв размер? Беше ли потвърдена факторната структура в независима извадка? Има ли публикувани доказателства от изследователи без търговски интерес в отговора? Добавя ли нещо към вече утвърдена алтернатива?
Един инструмент с честни отговори на тези въпроси си струва да бъде приет на сериозно, включително и неговите ограничения. Инструмент, чието валидиране се състои от страница с препоръки и твърдение, че милиони хора са го попълнили, е отговорил на съвсем различен въпрос. Популярността не е доказателство и броят на хората, които са попълнили даден тест, не говори нищо за това дали неговите резултати означават нещо.
Подложи го на тест
Четенето за измерванията е едно. Да видиш собствения си резултат с неговия източник, извадка за норма и ограничения е съвсем друго. Безплатен за попълване, не се изисква регистрация.
Продължи да четеш
- Какво е психометрия?Дисциплината, която установява дали дадено психологическо измерване е добро, и причината два теста, задаващи подобни въпроси, да се различават изключително много по стойността на своите резултати.
- Какво е надеждност в психологическото тестване?Надеждността е съгласуваност на измерването, а не точност. Един тест може да бъде много надежден и въпреки това да измерва грешното нещо, поради което това е първият зададен въпрос, но никога последният.
- Какво е конструктна валидност?Най-трудният въпрос при измерването: дали нещото, което измерваш, съществува така, както си го дефинирал, и дали твоят инструмент достига до него, а не до нещо сходно.
- Конвергентна и дискриминантна валидностДве огледални изисквания: един измерител трябва да съответства на това, на което трябва да съответства, и трябва да остане разграничим от това, което твърди, че не е. Повечето слаби инструменти се провалят на второто.
- Какво е алфа на Кронбах и какво не еНай-често отчитаната статистика в психологическото тестване и най-погрешно тълкуваната. Алфа не ти казва, че дадена скала е едноизмерна, а високата стойност често е по-скоро симптом, отколкото предимство.
- Стандартна грешка на измерването: с колко може да се отклонява твоят резултатВсеки резултат съдържа допустима грешка, а при повечето психологически тестове тя е по-голяма, отколкото хората предполагат. Това е числото, което ти показва кога една разлика е реална и кога е шум.
- Норми и перцентили: с какво се сравнява твоят резултатСуровият резултат не може да се интерпретира сам по себе си. Той придобива смисъл само спрямо референтна група, а коя група е използвана, е един от най-важните и най-слабо огласявани факти за всеки тест.
- Как всъщност се създава един психометричен тестОт дефинирането на конструкта до публикуваните норми, процесът отнема години и отхвърля по-голямата част от това, което е вложено в него. Ако познаваш стъпките, става очевидно кои от тях са пропуснати при един бърз онлайн тест.
- Какво означава, когато един тест се нарича валидиран?Думата е нерегулирана и се използва свободно от продукти, които не са положили нужните усилия. Ето какво означава тя, когато наистина има смисъл, и четирите въпроса, които разграничават двата случая.
- Защо повечето интернет тестове за личността не са надеждниНе защото са нечестни, а защото стъпките, които правят едно измерване надеждно, са невидими, скъпи и лесни за пропускане, а пропускането им не променя с нищо начина, по който изглежда резултатът.
- Какво може и какво не може да измери една самооценкаВъпросниците изискват от теб да бъдеш наблюдател на самия себе си, което работи по-добре за някои неща, отколкото за други. Да знаеш къде методът е силен и къде се проваля, променя начина, по който четеш всеки резултат.
- Какво означава, когато един тест предсказва нещоКорелация от 0,30 е силно откритие в изследванията на личността и слаба основа за решение за един човек. И двете твърдения са верни, а разминаването между тях причинява повечето злоупотреби с резултатите от тестовете.
- Скринингът не е диагнозаСкрининговият въпросник е създаден, за да улови възможно най-много потенциални случаи, приемайки висок процент на фалшиво положителни резултати като цена за това. Интерпретирането на скринингов резултат като диагноза противоречи на целта, за която е създаден.