noesisnoesis
Как работи измерването

Какво е валидност в психологическото тестване?

Валидността не е свойство, което един тест притежава. Тя е аргумент за това дали определена интерпретация на даден резултат за определена цел е защитима и трябва да се изгражда наново за всяка нова употреба.

Валидността задава въпроса дали един тест измерва това, което твърди, че измерва, и дали заключенията, които хората правят от неговите резултати, са основателни. Това е централният въпрос в психометрията и този, на който най-често се отговаря с маркетингово твърдение, а не с доказателства.

Съвременното разбиране, което се е запазило от работата на Messick през 80-те години на миналия век, е, че валидността не е фиксиран атрибут на един инструмент. Тя е свойство на дадена интерпретация на резултатите за специфична употреба. Същият въпросник може да бъде добре валидиран за описване на самооценката на даден човек и напълно невалидиран за вземане на решение дали той да бъде нает на работа. Да се каже "този тест е валиден", без да се каже за какво е валиден, не е твърдение; това е лозунг.

Видове доказателства

Валидността се изгражда от натрупани доказателства от няколко вида. По-старите текстове ги представят като отделни видове валидност; настоящото виждане ги разглежда като различни аргументи, подкрепящи един и същ случай.

Доказателствата за съдържанието задават въпроса дали твърденията покриват дадения конструкт правилно. Една скала за депресия, която задава въпроси само за съня и апетита, покрива соматичните симптоми и пропуска тези, свързани с настроението и познанието. Покритието на съдържанието обикновено се оценява от експерти в съответната област и това е причината много кратките скали винаги да са компромис.

Доказателствата за вътрешната структура задават въпроса дали твърденията се групират по начина, по който теорията твърди, че трябва да го правят. Ако един модел твърди, че има четири отделни аспекта, факторният анализ трябва да установи четири фактора, и което е изключително важно, в независима извадка, а не само в тази, въз основа на която е създадена скалата. Много голям брой инструменти възстановяват предвидената си структура в извадката за разработка и се провалят в тази на всеки друг.

Връзките с други променливи са мястото, където се извършва по-голямата част от работата. Конвергентните доказателства показват, че дадената скала корелира с нещата, с които трябва да корелира. Дискриминантните доказателства показват, че тя не корелира твърде силно с нещата, от които трябва да се различава. Това е хронично пренебрегвано изискване и това, което проваля много новосъздадени конструкти. Критериалните доказателства показват, че резултатът е свързан с важен изход, който е измерен по същото време или е прогнозиран предварително.

Доказателствата за последствията задават въпроса какво се случва, когато се използва даденият тест. Ако един инструмент систематично поставя в неблагоприятно положение дадена група по причини, които не са свързани с конструкта, това е проблем на валидността, а не просто етичен такъв.

Въпросът, който разобличава повечето твърдения

Най-острият тест за твърдение за валидност е инкременталната валидност: добавя ли този инструмент нещо към това, което един по-евтин, по-стар и утвърден метод вече ти казва?

Забележителен брой брандирани конструкти се провалят тук. Те корелират 0,7 или повече със съществуваща област от Big Five, прогнозират същите изходи със същата величина и не добавят нищо, след като по-старата мярка бъде статистически контролирана. Конструктът е нов; измерването не е. Ето защо разделите с критики в сериозната документация на инструментите толкова често се съсредоточават върху излишността, а не върху неточността.

Какво да търсиш

Когато някой твърди, че един тест е валидиран, полезните въпроси са конкретни. Валидиран спрямо какъв критерий? В коя популация и с какъв размер? Беше ли потвърдена факторната структура в независима извадка? Има ли публикувани доказателства от изследователи без търговски интерес в отговора? Добавя ли нещо към вече утвърдена алтернатива?

Един инструмент с честни отговори на тези въпроси си струва да бъде приет на сериозно, включително и неговите ограничения. Инструмент, чието валидиране се състои от страница с препоръки и твърдение, че милиони хора са го попълнили, е отговорил на съвсем различен въпрос. Популярността не е доказателство и броят на хората, които са попълнили даден тест, не говори нищо за това дали неговите резултати означават нещо.

Подложи го на тест

Четенето за измерванията е едно. Да видиш собствения си резултат с неговия източник, извадка за норма и ограничения е съвсем друго. Безплатен за попълване, не се изисква регистрация.

Продължи да четеш