noesisnoesis
Jak działa pomiar

Czym jest trafność w testach psychologicznych?

Trafność nie jest właściwością, którą test posiada. Jest to argument dotyczący tego, czy konkretna interpretacja konkretnego wyniku, dla konkretnego celu, jest uzasadniona i musi być odbudowywana na nowo dla każdego nowego zastosowania.

Trafność pyta o to, czy test mierzy to, co twierdzi, że mierzy, oraz czy wnioski, jakie ludzie wyciągają z jego wyników, są uzasadnione. To centralne pytanie w psychometrii i to, na które najczęściej odpowiada się twierdzeniem marketingowym, a nie dowodem.

Współczesne rozumienie, obowiązujące od czasu prac Messicka z lat 80., mówi, że trafność nie jest stałą cechą narzędzia. Jest to właściwość interpretacji wyników dla konkretnego zastosowania. Ten sam kwestionariusz może być dobrze zwalidowany do opisywania samopostrzegania danej osoby i całkowicie niezwalidowany do decydowania o jej zatrudnieniu. Stwierdzenie "ten test jest trafny" bez wskazania, dla czego jest trafny, nie jest twierdzeniem; to slogan.

Rodzaje dowodów

Trafność buduje się na podstawie zgromadzonych dowodów kilku typów. Starsze teksty przedstawiają je jako odrębne rodzaje trafności; obecny pogląd traktuje je jako różne argumenty wspierające jedną tezę.

Dowody dotyczące treści pytają, czy pozycje odpowiednio pokrywają konstrukt. Skala depresji, która pyta wyłącznie o sen i apetyt, obejmuje objawy somatyczne, a pomija te dotyczące nastroju i poznania. Pokrycie treściowe zwykle oceniają eksperci merytoryczni, i to właśnie dlatego bardzo krótkie skale zawsze są kompromisem.

Dowody dotyczące struktury wewnętrznej pytają, czy pozycje grupują się w sposób zgodny z teorią. Jeśli model zakłada cztery odrębne aspekty, analiza czynnikowa powinna odtworzyć cztery czynniki, i to, co kluczowe, w niezależnej próbie, a nie tylko w tej, na której zbudowano skalę. Bardzo wiele narzędzi odtwarza zamierzoną strukturę w próbie rozwojowej, ale zawodzi w każdej innej.

Związki z innymi zmiennymi to obszar, w którym dzieje się większość pracy. Dowody zbieżności pokazują, że skala koreluje z tym, z czym powinna korelować. Dowody rozbieżności pokazują, że nie koreluje zbyt wysoko z tym, od czego powinna się odróżniać: to wymóg chronicznie zaniedbywany i ten, który pogrąża wiele nowo markowanych konstruktów. Dowody kryterialne pokazują, że wynik wiąże się z istotnym rezultatem, mierzonym w tym samym czasie lub przewidywanym z wyprzedzeniem.

Dowody konsekwencyjne pytają, co się dzieje, gdy test jest stosowany. Jeśli narzędzie systematycznie stawia jakąś grupę w niekorzystnej sytuacji z powodów niezwiązanych z konstruktem, jest to problem trafności, a nie wyłącznie problem etyczny.

Pytanie, które demaskuje większość twierdzeń

Najostrzejszym sprawdzianem twierdzenia o trafności jest trafność przyrostowa: czy to narzędzie wnosi cokolwiek ponad to, co mówi już tańsza, starsza, ugruntowana miara?

Zaskakująco wiele markowanych konstruktów zawodzi w tym miejscu. Korelują na poziomie 0,7 lub wyższym z istniejącym wymiarem Wielkiej Piątki, przewidują te same rezultaty z taką samą siłą i nie wnoszą nic nowego, gdy statystycznie skontroluje się starszą miarę. Konstrukt jest nowy; pomiar już nie. Dlatego sekcje krytyczne poważnej dokumentacji narzędzi tak często dotyczą redundancji, a nie niedokładności.

Na co zwracać uwagę

Gdy ktoś twierdzi, że test jest zwalidowany, przydatne pytania są konkretne. Zwalidowany względem jakiego kryterium? W jakiej populacji, o jakiej liczebności? Czy struktura czynnikowa została potwierdzona w niezależnej próbie? Czy istnieją opublikowane dowody od badaczy niemających interesu komercyjnego w takiej czy innej odpowiedzi? Czy narzędzie wnosi cokolwiek ponad ugruntowaną alternatywę?

Narzędzie, które udziela uczciwych odpowiedzi na te pytania, zasługuje na poważne potraktowanie, wraz z jego ograniczeniami. Narzędzie, którego walidacja polega na stronie z opiniami użytkowników i twierdzeniu, że wykonały je miliony ludzi, odpowiedziało na zupełnie inne pytanie: popularność nie jest dowodem, a liczba osób, które wykonały test, nic nie mówi o tym, czy jego wyniki cokolwiek znaczą.

Wypróbuj to sam

Czytanie o pomiarze to jedno. Zobaczenie własnego wyniku wraz z jego źródłem, próbą normalizacyjną i ograniczeniami to drugie. Bezpłatny test, bez rejestracji.

Czytaj dalej

Czym jest trafność w testach psychologicznych? | NOESIS