Czym jest rzetelność w testach psychologicznych?
Rzetelność to spójność pomiaru, nie poprawność. Test może być bardzo rzetelny i wciąż mierzyć niewłaściwą rzecz, dlatego jest to pierwsze pytanie, które się zadaje, i nigdy ostatnie.
Rzetelność to stopień, w jakim pomiar jest powtarzalny, a nie stanowi szumu. Gdybyś zważył się trzy razy w ciągu minuty i uzyskał 71, 78 i 66 kilogramów, waga byłaby nierzetelna, a ty nie miałbyś sposobu, by na jej podstawie poznać swoją rzeczywistą wagę. Pomiar psychologiczny mierzy się z tym samym problemem, dysponując znacznie mniej precyzyjnym sprzętem.
Najważniejsza rzecz, którą trzeba zrozumieć w kwestii rzetelności, to to, czego ona nie zapewnia. Waga łazienkowa, która konsekwentnie pokazuje wynik o osiem kilogramów za wysoki, jest całkowicie rzetelna i całkowicie błędna. Rzetelność dotyczy spójności; to, czy liczba oznacza to, co powinna, to osobna kwestia, zwana trafnością. Rzetelność jest konieczna dla trafności, ale daleka od wystarczającej.
Formy, jakie przybiera
Spójność wewnętrzna sprawdza, czy pozycje w skali są ze sobą zgodne. Jeśli dziesięć pytań ma mierzyć tę samą ukrytą cechę, osoby, które wysoko oceniają jedno z nich, powinny mieć tendencję do wysokiego oceniania pozostałych. Zwykle raportuje się ją jako alfa Cronbacha lub, lepiej, omega McDonalda.
Rzetelność test-retest sprawdza, czy ta sama osoba uzyskuje podobne wyniki przy dwóch różnych okazjach. To forma, która ma największe znaczenie dla cech, które z definicji powinny być stabilne. To także forma najczęściej pomijana w raportach, ponieważ wymaga odnalezienia tych samych uczestników po kilku tygodniach.
Rzetelność międzysędziowska ma zastosowanie wtedy, gdy narzędzie jest oceniane przez ludzi: wywiady kliniczne, techniki projekcyjne, obserwacja zachowania. Sprawdza, czy dwóch przeszkolonych sędziów, patrząc na ten sam materiał, dochodzi do tego samego wniosku.
Rzetelność form równoległych sprawdza, czy dwie różne wersje tego samego testu, zbudowane tak, aby były równoważne, dają te same wyniki. Ma to znaczenie wszędzie tam, gdzie test jest stosowany więcej niż raz i istnieje obawa dotycząca ekspozycji na pozycje testowe.
Interpretacja liczb
Współczynniki rzetelności przyjmują wartości od 0 do 1. Konwencje są przybliżone i często nadużywane, ale w przybliżeniu: powyżej 0,90 jest wymagane tam, gdzie wynik wpływa na życie danej osoby, 0,80 do 0,90 to solidny poziom dla większości zastosowań praktycznych, 0,70 do 0,80 jest akceptowalne dla badań naukowych i porównań grupowych, a poniżej 0,70 oznacza, że wynik zawiera więcej szumu, niż mogą wytrzymać większość wniosków.
Dwie uwagi dotyczące tych progów. Po pierwsze, są to konwencje, a nie prawa: akceptowalny poziom zależy całkowicie od tego, do czego wynik będzie wykorzystywany. Po drugie, bardzo wysoka alfa w krótkiej skali zwykle wskazuje, że pozycje są niemal parafrazami siebie nawzajem, co kupuje spójność kosztem pokrycia konstruktu. Skala złożona z dziesięciu pytań, które wszystkie pytają "czy jesteś zorganizowany?" nieco innymi słowami, będzie miała doskonałą spójność wewnętrzną i wąskie ujęcie sumienności.
Co to oznacza dla twojego wyniku
Rzetelność przekłada się bezpośrednio na to, ile zaufania zasługuje pojedyncza liczba. Test o rzetelności 0,85 niesie ze sobą błąd pomiaru na tyle duży, że różnica kilku punktów między dwiema osobami, albo między twoim dzisiejszym wynikiem a wynikiem sprzed miesiąca, z dużym prawdopodobieństwem stanowi szum, a nie sygnał.
To praktyczna konsekwencja: dobre narzędzie podaje swoją rzetelność, dzięki czemu wiesz, jak duża jest niepewność wokół twojego wyniku. Technicznym wyrazem tej niepewności jest standardowy błąd pomiaru, który przekształca współczynnik rzetelności w przedział plus minus wokół wyniku.
Narzędzie, które w ogóle nie podaje wartości rzetelności, nie staje się przez to bardziej precyzyjne. Po prostu nie zdecydowało się powiedzieć ci, jak bardzo jest nieprecyzyjne.
Wypróbuj to sam
Czytanie o pomiarze to jedno. Zobaczenie własnego wyniku wraz z jego źródłem, próbą normalizacyjną i ograniczeniami to drugie. Bezpłatny test, bez rejestracji.
Czytaj dalej
- Czym jest psychometria?Dyscyplina, która rozstrzyga, czy pomiar psychologiczny jest dobry, i powód, dla którego dwa testy zadające podobne pytania mogą się ogromnie różnić pod względem wartości swoich wyników.
- Czym jest trafność w testach psychologicznych?Trafność nie jest właściwością, którą test posiada. Jest to argument dotyczący tego, czy konkretna interpretacja konkretnego wyniku, dla konkretnego celu, jest uzasadniona i musi być odbudowywana na nowo dla każdego nowego zastosowania.
- Czym jest trafność konstruktu?Najtrudniejsze pytanie w pomiarze: czy rzecz, którą mierzysz, istnieje tak, jak ją zdefiniowałeś, i czy twoje narzędzie dociera do niej, a nie do czegoś zbliżonego.
- Trafność zbieżna i różnicowaDwa wymagania będące odbiciem siebie nawzajem: miara musi zgadzać się z tym, z czym powinna się zgadzać, i musi pozostać odrębna od tego, czym twierdzi, że nie jest. Większość słabych narzędzi zawodzi w drugim z nich.
- Co to jest alfa Cronbacha i czym nie jestNajczęściej podawana statystyka w testowaniu psychologicznym i najczęściej błędnie odczytywana. Alfa nie mówi ci, że skala jest jednowymiarowa, a wysoka wartość jest często symptomem, a nie zaletą.
- Standardowy błąd pomiaru: o ile twój wynik może się różnić od rzeczywistegoKażdy wynik niesie ze sobą margines błędu, a w przypadku większości testów psychologicznych jest on szerszy, niż się zwykle przypuszcza. To liczba, która mówi ci, kiedy różnica jest rzeczywista, a kiedy jest szumem.
- Normy i percentyle: z czym porównywany jest twój wynikWynik surowy jest niemożliwy do zinterpretowania sam w sobie. Nabiera znaczenia tylko w odniesieniu do grupy odniesienia, a to, która grupa została użyta, jest jednym z najbardziej istotnych i najmniej ujawnianych faktów o każdym teście.
- Jak faktycznie powstaje test psychometrycznyOd definicji konstruktu do opublikowanych norm, ta sekwencja trwa latami i odrzuca większość tego, co do niej wchodzi. Znajomość tych kroków sprawia, że oczywiste staje się, które z nich zostały pominięte w szybkim quizie online.
- Co to znaczy, że test jest zwalidowany?To słowo jest nieregulowane i swobodnie używane przez produkty, które nie wykonały żadnej z potrzebnej pracy. Oto co znaczy, gdy naprawdę coś znaczy, oraz cztery pytania, które oddzielają jeden przypadek od drugiego.
- Dlaczego większość internetowych testów osobowości nie jest rzetelnaNie dlatego, że są nieuczciwe, ale dlatego, że kroki, które czynią pomiar wiarygodnym, są niewidoczne, kosztowne i łatwe do pominięcia, a ich pominięcie niczego nie zmienia w wyglądzie wyniku.
- Co samoopis może, a czego nie może zmierzyćKwestionariusze proszą cię o bycie obserwatorem samego siebie, co działa lepiej w przypadku niektórych rzeczy niż innych. Wiedza o tym, gdzie ta metoda jest silna a gdzie zawodzi, zmienia sposób, w jaki odczytujesz jakikolwiek wynik.
- Co to znaczy, że test coś przewidujeKorelacja na poziomie 0,30 to silny wynik w badaniach osobowości i słaba podstawa do decyzji dotyczącej jednej osoby. Obie stwierdzenia są prawdziwe, a rozbieżność między nimi powoduje większość niewłaściwych zastosowań wyników testów.
- Badanie przesiewowe to nie diagnozaKwestionariusz przesiewowy jest skonstruowany tak, aby wychwycić jak najwięcej możliwych przypadków, przyjmując wysoki wskaźnik wyników fałszywie pozytywnych jako cenę. Odczytywanie wyniku przesiewowego jako diagnozy odwraca to, do czego został on stworzony.