Czym jest trafność konstruktu?
Najtrudniejsze pytanie w pomiarze: czy rzecz, którą mierzysz, istnieje tak, jak ją zdefiniowałeś, i czy twoje narzędzie dociera do niej, a nie do czegoś zbliżonego.
Trafność teoretyczna (konstruktowa) odpowiada na pytanie, czy narzędzie mierzy konstrukt teoretyczny, który rzekomo mierzy, a nie coś z nim skorelowanego, coś węższego od niego, albo nic spójnego w ogóle. Jest to najgłębsza forma dowodu trafności i taka, której ustalenie zajmuje lata, a nie jedno badanie.
Trudność ma charakter strukturalny. Konstrukt taki jak odporność psychiczna czy inteligencja emocjonalna nie jest przedmiotem; jest proponowaną prawidłowością w zachowaniu. Aby wykazać, że skala go mierzy, trzeba jednocześnie bronić twierdzenia, że konstrukt istnieje w opisanej postaci, i że te konkretne pozycje do niego docierają. Obu twierdzeń nie da się rozdzielić, dlatego Cronbach i Meehl, którzy wprowadzili tę ideę w 1955 roku, ujęli ją jako testowanie całej sieci teoretycznej, a nie jednego narzędzia.
Jak buduje się dowód
Przewidywane wzorce korelacji. Teoria określa, z czym konstrukt powinien się wiązać i jak silnie. Współczucie dla siebie powinno korelować dodatnio z satysfakcją z życia, ujemnie z depresją i jedynie umiarkowanie z samooceną. Gdyby korelowało na poziomie 0,9 z samooceną, nie byłoby odrębnym konstruktem. Każda z tych przewidywań jest twierdzeniem, które można sprawdzić, a niepowodzenie choćby jednego jest informacyjne.
Oczekiwane różnice między grupami. Jeśli teoria mówi, że cecha rozwija się wraz z wiekiem albo jest podwyższona w populacji klinicznej, narzędzie powinno to wykazać. Niewykrycie różnicy, której wymaga teoria, jest dowodem przeciwko narzędziu, teorii, albo obu naraz.
Reakcja na interwencję. Jeśli konstrukt ma być trenowalny, wyniki powinny się zmieniać po treningu, a nie zmieniać się w grupie kontrolnej. Konstrukty, które nigdy na nic nie reagują, trudno odróżnić od artefaktów.
Struktura wewnętrzna. Struktura czynnikowa powinna odpowiadać strukturze teoretycznej, i co ważne, na nowej próbie. Eksploracyjna analiza czynnikowa na danych rozwojowych znajdzie dowolną strukturę, która została w nie zaprojektowana; konfirmacyjna analiza na nowych danych to moment, w którym twierdzenie jest faktycznie testowane.
Idea wielocechowo-wielometodowa
Wkład Campbella i Fiske'a z 1959 roku polegał na tym, że nalegali, aby trafność teoretyczna wymagała dwóch rzeczy naraz: pomiary tej samej cechy różnymi metodami powinny być ze sobą zgodne, a pomiary różnych cech tą samą metodą nie powinny.
Ta druga część to miejsce, w którym większość narzędzi ma trudności. Jeśli twoja samoopisowa empatia koreluje na poziomie 0,7 z twoją samoopisową ugodowością, a na poziomie 0,2 z empatią ocenianą przez obserwatora, to najsilniejszą rzeczą, którą mierzy twój kwestionariusz, nie jest empatia, tylko twój ogólny sposób opisywania siebie w kwestionariuszach. Wariancja metody jest jednym z najbardziej uporczywych problemów w badaniach opartych na samoopisie i to właśnie z tego powodu poważna praca walidacyjna poszukuje kryterium spoza kwestionariusza, wszędzie tam, gdzie takie istnieje.
Dlaczego to ma znaczenie przy czytaniu twoich wyników
Trafność teoretyczna to coś, co stoi między wynikiem a jego interpretacją. Kiedy dobrze zwalidowane narzędzie podaje, że osiągasz wysoki wynik w danej cesze, łańcuch rozumowania stojący za tym stwierdzeniem obejmuje dziesięciolecia opublikowanych prac ustalających, że cecha zachowuje się jak spójna wielkość, że te pozycje ją śledzą, i że wynik oznacza coś podobnego u różnych osób, które go uzyskują.
Kiedy test bez żadnej walidacji teoretycznej podaje to samo, wynik jest liczbą wygenerowaną przez algorytm, którego nikt nie sprawdził. Oba wyglądają identycznie na ekranie z wynikami. Różnica leży całkowicie w dokumentacji, dlatego warto jej szukać.
Wypróbuj to sam
Czytanie o pomiarze to jedno. Zobaczenie własnego wyniku wraz z jego źródłem, próbą normalizacyjną i ograniczeniami to drugie. Bezpłatny test, bez rejestracji.
Czytaj dalej
- Czym jest psychometria?Dyscyplina, która rozstrzyga, czy pomiar psychologiczny jest dobry, i powód, dla którego dwa testy zadające podobne pytania mogą się ogromnie różnić pod względem wartości swoich wyników.
- Czym jest rzetelność w testach psychologicznych?Rzetelność to spójność pomiaru, nie poprawność. Test może być bardzo rzetelny i wciąż mierzyć niewłaściwą rzecz, dlatego jest to pierwsze pytanie, które się zadaje, i nigdy ostatnie.
- Czym jest trafność w testach psychologicznych?Trafność nie jest właściwością, którą test posiada. Jest to argument dotyczący tego, czy konkretna interpretacja konkretnego wyniku, dla konkretnego celu, jest uzasadniona i musi być odbudowywana na nowo dla każdego nowego zastosowania.
- Trafność zbieżna i różnicowaDwa wymagania będące odbiciem siebie nawzajem: miara musi zgadzać się z tym, z czym powinna się zgadzać, i musi pozostać odrębna od tego, czym twierdzi, że nie jest. Większość słabych narzędzi zawodzi w drugim z nich.
- Co to jest alfa Cronbacha i czym nie jestNajczęściej podawana statystyka w testowaniu psychologicznym i najczęściej błędnie odczytywana. Alfa nie mówi ci, że skala jest jednowymiarowa, a wysoka wartość jest często symptomem, a nie zaletą.
- Standardowy błąd pomiaru: o ile twój wynik może się różnić od rzeczywistegoKażdy wynik niesie ze sobą margines błędu, a w przypadku większości testów psychologicznych jest on szerszy, niż się zwykle przypuszcza. To liczba, która mówi ci, kiedy różnica jest rzeczywista, a kiedy jest szumem.
- Normy i percentyle: z czym porównywany jest twój wynikWynik surowy jest niemożliwy do zinterpretowania sam w sobie. Nabiera znaczenia tylko w odniesieniu do grupy odniesienia, a to, która grupa została użyta, jest jednym z najbardziej istotnych i najmniej ujawnianych faktów o każdym teście.
- Jak faktycznie powstaje test psychometrycznyOd definicji konstruktu do opublikowanych norm, ta sekwencja trwa latami i odrzuca większość tego, co do niej wchodzi. Znajomość tych kroków sprawia, że oczywiste staje się, które z nich zostały pominięte w szybkim quizie online.
- Co to znaczy, że test jest zwalidowany?To słowo jest nieregulowane i swobodnie używane przez produkty, które nie wykonały żadnej z potrzebnej pracy. Oto co znaczy, gdy naprawdę coś znaczy, oraz cztery pytania, które oddzielają jeden przypadek od drugiego.
- Dlaczego większość internetowych testów osobowości nie jest rzetelnaNie dlatego, że są nieuczciwe, ale dlatego, że kroki, które czynią pomiar wiarygodnym, są niewidoczne, kosztowne i łatwe do pominięcia, a ich pominięcie niczego nie zmienia w wyglądzie wyniku.
- Co samoopis może, a czego nie może zmierzyćKwestionariusze proszą cię o bycie obserwatorem samego siebie, co działa lepiej w przypadku niektórych rzeczy niż innych. Wiedza o tym, gdzie ta metoda jest silna a gdzie zawodzi, zmienia sposób, w jaki odczytujesz jakikolwiek wynik.
- Co to znaczy, że test coś przewidujeKorelacja na poziomie 0,30 to silny wynik w badaniach osobowości i słaba podstawa do decyzji dotyczącej jednej osoby. Obie stwierdzenia są prawdziwe, a rozbieżność między nimi powoduje większość niewłaściwych zastosowań wyników testów.
- Badanie przesiewowe to nie diagnozaKwestionariusz przesiewowy jest skonstruowany tak, aby wychwycić jak najwięcej możliwych przypadków, przyjmując wysoki wskaźnik wyników fałszywie pozytywnych jako cenę. Odczytywanie wyniku przesiewowego jako diagnozy odwraca to, do czego został on stworzony.