Dlaczego większość internetowych testów osobowości nie jest rzetelna
Nie dlatego, że są nieuczciwe, ale dlatego, że kroki, które czynią pomiar wiarygodnym, są niewidoczne, kosztowne i łatwe do pominięcia, a ich pominięcie niczego nie zmienia w wyglądzie wyniku.
Darmowy test osobowości online i zwalidowany instrument psychometryczny dają na wyjściu wynik, który wygląda identycznie: wynik, percentyl, akapit opisujący ciebie. Różnica tkwi całkowicie w pracy, której nie widzisz na ekranie z wynikami.
Warto to sprecyzować, ponieważ powszechne przekonanie, że testy internetowe to oszustwo, jest w większości błędne i niewiele wyjaśnia. Większość z nich powstaje bez intencji wprowadzania w błąd. Są niewiarygodne z powodów strukturalnych.
Co zwykle jest pomijane
Analiza pozycji. W dobrze skonstruowanej skali większość opracowanych pozycji jest odrzucana po badaniu pilotażowym: pozycje, na które nikt nie odpowiada różnie, pozycje słabo korelujące z wynikiem ogólnym, pozycje obciążające więcej niż jeden czynnik, pozycje zachowujące się różnie w grupach wiekowych lub językowych. Test napisany i opublikowany bez pilotażu zachowuje wszystko, w tym pozycje, które nie działają.
Niezależne potwierdzenie struktury. Analiza czynnikowa na danych, na podstawie których zbudowano skalę, zawsze odtworzy zaprojektowaną strukturę. Potwierdzenie jej w nowej próbie to odrębne badanie i to właśnie na tym etapie znaczna część skal zawodzi.
Normy. Percentyl musi skądś pochodzić. Jeśli serwis nie podaje swojej populacji odniesienia, liczba jest wyliczana albo na podstawie wcześniejszych użytkowników, czyli grupy samodzielnie się kwalifikującej i o nieznanym składzie, albo w istocie z niczego konkretnego.
Dane test-retest. Ustalenie, że ludzie uzyskują ten sam wynik miesiąc później, wymaga ponownego ich odnalezienia. Prawie nikt tego nie robi, co oznacza, że stabilność, którą sugeruje słowo "cecha", nie została wykazana.
Zachęty projektowe działają w niewłaściwym kierunku
Test zbudowany dla zaangażowania jest optymalizowany pod inny cel niż test zbudowany dla dokładności, a te dwa cele rozchodzą się w przewidywalny sposób.
Pochlebne wyniki działają lepiej. Wynik, który mówi ci coś niemiłego, jest rzadziej udostępniany, więc wyniki dryfują w stronę opisów, które każdy rozpoznaje u siebie. To efekt Barnuma, wykazany w latach czterdziestych XX wieku i od tamtej pory wielokrotnie powtarzany: ludzie oceniają ogólne opisy osobowości jako wysoce dokładne w odniesieniu specyficznie do siebie.
Typy działają lepiej niż wymiary. "Jesteś Architektem" łatwiej udostępnić niż "jesteś na 68. percentylu otwartości z szerokim przedziałem ufności". Typy dodatkowo skrywają błąd pomiaru, ponieważ osoba o jeden punkt po dowolnej stronie granicy kategorii otrzymuje zupełnie inną etykietę.
Krótkie działa lepiej niż adekwatne. Każde dodatkowe pytanie zmniejsza liczbę osób, które dokończą test, więc testy są skracane do długości maksymalizującej dokończenie, a nie do długości pokrywającej konstrukt.
Żadne z tych zjawisk nie jest kłamstwem. To optymalizacja pod metrykę inną niż dokładność.
Jak to rozpoznać w około trzydzieści sekund
Sprawdź, czy podano nazwę instrumentu źródłowego, autorów i rok. Sprawdź, czy podano, z jakiej populacji pochodzą normy. Sprawdź, czy jest jakiekolwiek uznanie ograniczeń lub błędu pomiaru. Sprawdź, czy wynik jest wynikiem ciągłym czy kategorią. Sprawdź, czy ta sama strona obiecuje też wskazać twój idealny zawód, partnera czy sens życia na podstawie dwudziestu pytań.
Test, który nazywa swój instrument, podaje jego źródło, określa swoje normy i mówi, czego nie może ci powiedzieć, wykonał tę pracę. Ten, który nie robi niczego z tego, może wciąż być przyjemnym sposobem spędzenia pięciu minut, ale liczba, którą generuje, jest dekoracją.
Każdy instrument w katalogu NOESIS podaje, który opublikowany test wdraża, kto go napisał, w którym roku, jak jest punktowany oraz czego jego wyniki nie ustalają. To ostatnie jest tym, z czym warto porównywać inne testy.
Wypróbuj to sam
Czytanie o pomiarze to jedno. Zobaczenie własnego wyniku wraz z jego źródłem, próbą normalizacyjną i ograniczeniami to drugie. Bezpłatny test, bez rejestracji.
Czytaj dalej
- Czym jest psychometria?Dyscyplina, która rozstrzyga, czy pomiar psychologiczny jest dobry, i powód, dla którego dwa testy zadające podobne pytania mogą się ogromnie różnić pod względem wartości swoich wyników.
- Czym jest rzetelność w testach psychologicznych?Rzetelność to spójność pomiaru, nie poprawność. Test może być bardzo rzetelny i wciąż mierzyć niewłaściwą rzecz, dlatego jest to pierwsze pytanie, które się zadaje, i nigdy ostatnie.
- Czym jest trafność w testach psychologicznych?Trafność nie jest właściwością, którą test posiada. Jest to argument dotyczący tego, czy konkretna interpretacja konkretnego wyniku, dla konkretnego celu, jest uzasadniona i musi być odbudowywana na nowo dla każdego nowego zastosowania.
- Czym jest trafność konstruktu?Najtrudniejsze pytanie w pomiarze: czy rzecz, którą mierzysz, istnieje tak, jak ją zdefiniowałeś, i czy twoje narzędzie dociera do niej, a nie do czegoś zbliżonego.
- Trafność zbieżna i różnicowaDwa wymagania będące odbiciem siebie nawzajem: miara musi zgadzać się z tym, z czym powinna się zgadzać, i musi pozostać odrębna od tego, czym twierdzi, że nie jest. Większość słabych narzędzi zawodzi w drugim z nich.
- Co to jest alfa Cronbacha i czym nie jestNajczęściej podawana statystyka w testowaniu psychologicznym i najczęściej błędnie odczytywana. Alfa nie mówi ci, że skala jest jednowymiarowa, a wysoka wartość jest często symptomem, a nie zaletą.
- Standardowy błąd pomiaru: o ile twój wynik może się różnić od rzeczywistegoKażdy wynik niesie ze sobą margines błędu, a w przypadku większości testów psychologicznych jest on szerszy, niż się zwykle przypuszcza. To liczba, która mówi ci, kiedy różnica jest rzeczywista, a kiedy jest szumem.
- Normy i percentyle: z czym porównywany jest twój wynikWynik surowy jest niemożliwy do zinterpretowania sam w sobie. Nabiera znaczenia tylko w odniesieniu do grupy odniesienia, a to, która grupa została użyta, jest jednym z najbardziej istotnych i najmniej ujawnianych faktów o każdym teście.
- Jak faktycznie powstaje test psychometrycznyOd definicji konstruktu do opublikowanych norm, ta sekwencja trwa latami i odrzuca większość tego, co do niej wchodzi. Znajomość tych kroków sprawia, że oczywiste staje się, które z nich zostały pominięte w szybkim quizie online.
- Co to znaczy, że test jest zwalidowany?To słowo jest nieregulowane i swobodnie używane przez produkty, które nie wykonały żadnej z potrzebnej pracy. Oto co znaczy, gdy naprawdę coś znaczy, oraz cztery pytania, które oddzielają jeden przypadek od drugiego.
- Co samoopis może, a czego nie może zmierzyćKwestionariusze proszą cię o bycie obserwatorem samego siebie, co działa lepiej w przypadku niektórych rzeczy niż innych. Wiedza o tym, gdzie ta metoda jest silna a gdzie zawodzi, zmienia sposób, w jaki odczytujesz jakikolwiek wynik.
- Co to znaczy, że test coś przewidujeKorelacja na poziomie 0,30 to silny wynik w badaniach osobowości i słaba podstawa do decyzji dotyczącej jednej osoby. Obie stwierdzenia są prawdziwe, a rozbieżność między nimi powoduje większość niewłaściwych zastosowań wyników testów.
- Badanie przesiewowe to nie diagnozaKwestionariusz przesiewowy jest skonstruowany tak, aby wychwycić jak najwięcej możliwych przypadków, przyjmując wysoki wskaźnik wyników fałszywie pozytywnych jako cenę. Odczytywanie wyniku przesiewowego jako diagnozy odwraca to, do czego został on stworzony.