Mi az érvényesség a pszichológiai tesztelésben?
Az érvényesség nem olyan tulajdonság, amellyel egy teszt rendelkezik. Az érvényesség érvelés arról, hogy egy adott pontszám adott értelmezése adott célra védhető-e, és ezt minden új felhasználásnál újra fel kell építeni.
Az érvényesség azt vizsgálja, hogy egy teszt azt méri-e, aminek a mérését állítja, és hogy megalapozottak-e azok a következtetések, amelyeket az emberek a pontszámaiból levonnak. Ez a pszichometria központi kérdése, és egyben az, amelyre a leggyakrabban marketingállítással válaszolnak bizonyíték helyett.
A modern felfogás, amely Messick 1980-as évekbeli munkássága óta érvényben van, az, hogy az érvényesség nem egy mérőeszköz rögzített tulajdonsága. Az érvényesség a pontszámok egy értelmezésének tulajdonsága egy konkrét felhasználás tekintetében. Ugyanaz a kérdőív lehet jól validált arra, hogy leírja egy személy önészlelését, és teljesen validálatlan arra, hogy eldöntsük, felvegyük-e az illetőt. Ha azt mondjuk, hogy "ez a teszt érvényes", de nem mondjuk meg, mire nézve érvényes, az nem állítás, hanem szlogen.
A bizonyítékok fajtái
Az érvényesség többféle, összegyűlt bizonyítékból épül fel. A régebbi szakirodalom ezeket az érvényesség különálló fajtáiként mutatja be; a jelenlegi felfogás egyetlen ügyet alátámasztó, különböző érvekként kezeli őket.
A tartalmi bizonyíték azt vizsgálja, hogy a tételek megfelelően lefedik-e a konstruktumot. Egy depresszióskála, amely csak az alvásra és az étvágyra kérdez rá, lefedi a szomatikus tüneteket, de kihagyja a hangulati és kognitív tüneteket. A tartalmi lefedettséget általában szakértők ítélik meg, és ez az oka annak, hogy a nagyon rövid skálák mindig kompromisszumot jelentenek.
A belső szerkezeti bizonyíték azt vizsgálja, hogy a tételek úgy csoportosulnak-e, ahogyan az elmélet szerint kellene. Ha egy modell négy különálló aspektust feltételez, a faktorelemzésnek négy faktort kell visszaadnia, és ami döntő: egy független mintán is, nem csak azon, amelyen a skálát kidolgozták. Rengeteg mérőeszköz visszaadja a tervezett szerkezetét a fejlesztési mintán, más mintákon azonban nem.
A más változókkal való kapcsolatok területén zajlik a munka nagy része. A konvergens bizonyíték azt mutatja, hogy a skála korrelál azokkal, amelyekkel korrelálnia kell. A diszkrimináns bizonyíték azt mutatja, hogy nem korrelál túl erősen azokkal, amelyektől különböznie kellene; ez egy krónikusan elhanyagolt követelmény, és ezen bukik el sok újonnan márkázott konstruktum. A kritériumbizonyíték azt mutatja, hogy a pontszám összefügg egy lényeges kimenettel, amelyet vagy ugyanabban az időben mérnek, vagy előre jeleznek.
A következményekre vonatkozó bizonyíték azt vizsgálja, mi történik, amikor a tesztet használják. Ha egy mérőeszköz szisztematikusan hátrányos helyzetbe hoz egy csoportot a konstruktumtól független okokból, az érvényességi probléma, nem csupán etikai.
A kérdés, amely a legtöbb állítást leleplezi
Egy érvényességi állítás legélesebb próbája az inkrementális érvényesség: hozzáad-e ez a mérőeszköz bármit ahhoz, amit egy olcsóbb, régebbi, bevált mérőeszköz már elárul?
Figyelemre méltóan sok márkázott konstruktum itt elbukik. 0.7-es vagy magasabb korrelációt mutatnak egy meglévő Big Five területtel, ugyanazokat a kimeneteket jelzik előre ugyanakkora mértékben, és semmit sem tesznek hozzá, ha a régebbi mérőeszközt statisztikailag kontrolláljuk. A konstruktum új; a mérés nem. Ezért fordul elő, hogy a komoly mérőeszköz-dokumentációk kritikai részei olyan gyakran a redundanciára, nem pedig a pontatlanságra összpontosítanak.
Mire érdemes figyelni
Amikor valaki azt állítja, hogy egy teszt validált, a hasznos kérdések konkrétak. Milyen kritériumhoz viszonyítva validálták? Melyik populáción, mekkora mintán? Megerősítették-e a faktorszerkezetet egy független mintán? Vannak-e publikált bizonyítékok olyan kutatóktól, akiknek nem fűződik üzleti érdekük az eredményhez? Hozzáad-e bármit egy bevált alternatívához képest?
Az a mérőeszköz, amely őszinte válaszokat ad ezekre a kérdésekre, komolyan vehető, a korlátaival együtt. Az a mérőeszköz viszont, amelynek validálása egy ajánlásokat tartalmazó oldalból és abból az állításból áll, hogy milliók töltötték már ki, egészen más kérdésre válaszolt: a népszerűség nem bizonyíték, és az, hogy hányan töltöttek ki egy tesztet, semmit sem mond arról, hogy a pontszámainak van-e bármilyen jelentése.
Tegye próbára
Egy dolog a mérésről olvasni. Más dolog látni a saját pontszámát a forrásával, a normamintájával és a korlátaival együtt. Ingyenes, regisztráció nem szükséges.
Olvasson tovább
- Mi a pszichometria?Az a tudományág, amely megállapítja, hogy egy pszichológiai mérés megfelelő-e; és ez az oka annak, hogy két, hasonló kérdéseket feltevő teszt eredményeinek értéke rendkívül eltérő lehet.
- Mi a megbízhatóság a pszichológiai tesztelésben?A megbízhatóság a mérés következetességét jelenti, nem a helyességét. Egy teszt lehet nagyon megbízható, és mégis rossz dolgot mérhet. Ezért ez az első kérdés, amelyet felteszünk, és soha nem az utolsó.
- Mi a konstruktumérvényesség?A mérés legnehezebb kérdése: létezik-e az, amit mér, úgy, ahogyan Ön meghatározta, és valóban azt éri-e el a mérőeszköze, nem pedig valami ahhoz közel esőt.
- Konvergens és diszkrimináns érvényességKét egymást tükröző követelmény: egy mérésnek egyeznie kell azzal, amivel egyeznie kell, és elkülönülnie attól, aminek állítása szerint nem azonos. A legtöbb gyenge mérőeszköz a második követelménynek nem felel meg.
- Mi a Cronbach-alfa, és mi nemA pszichológiai tesztelés leggyakrabban közölt statisztikai mutatója, és egyben a leggyakrabban félreértett is. Az alfa nem árulja el, hogy egy skála egydimenziós-e, és a magas érték gyakran inkább tünet, mint erény.
- A mérés standard hibája: mennyivel térhet el az Ön pontszámaMinden pontszámnak van hibahatára, és a legtöbb pszichológiai teszt esetében ez szélesebb, mint azt az emberek gondolnák. Ez az a szám, amely megmutatja, mikor valódi egy különbség, és mikor csupán zaj.
- Normák és percentilisek: mihez hasonlítják az Ön pontszámátEgy nyers pontszám önmagában nem értelmezhető. Csak egy referenciacsoporthoz viszonyítva válik jelentésessé, és az, hogy melyik csoportot használták, az egyik legnagyobb következményekkel járó és legkevésbé hangoztatott tény bármely tesztről.
- Hogyan készül valójában egy pszichometriai tesztA konstruktum meghatározásától a közzétett normákig a folyamat évekig tart, és a beletett anyag nagy részét elveti. Ha ismeri a lépéseket, nyilvánvalóvá válik, melyeket hagyott ki egy gyors online kvíz.
- Mit jelent, ha egy tesztet validáltnak neveznek?A kifejezés nem szabályozott, és szabadon használják olyan termékek is, amelyek semmit sem tettek meg érte. Az alábbiakban bemutatjuk, mit jelent, amikor valóban jelent valamit, és azt a négy kérdést, amely elválasztja egymástól a két esetet.
- Miért nem megbízható a legtöbb internetes személyiségtesztNem azért, mert nem őszinték, hanem mert azok a lépések, amelyektől egy mérés megbízhatóvá válik, láthatatlanok, költségesek és könnyen kihagyhatók; kihagyásuk pedig semmit sem változtat azon, hogyan néz ki az eredmény.
- Mit képes mérni az önbeszámoló, és mit nemA kérdőívek arra kérik Önt, hogy saját maga megfigyelője legyen, ami bizonyos dolgok esetében jobban működik, mint másoknál. Ha tudja, hol erős és hol mond csődöt ez a módszer, másképp fog olvasni bármilyen eredményt.
- Mit jelent, ha egy teszt bejósol valamitA 0,30-as korreláció erős eredménynek számít a személyiségkutatásban, ugyanakkor gyenge alapot nyújt egy adott személyre vonatkozó döntéshez. Mindkét állítás igaz, és a kettő közötti szakadék okozza a teszteredményekkel való visszaélések többségét.
- A szűrés nem diagnózisEgy szűrő kérdőívet arra terveznek, hogy a lehető legtöbb lehetséges esetet kiszűrje, és ennek áraként elfogadja a magas álpozitív arányt. Ha egy szűrési pontszámot diagnózisként olvasunk, azzal éppen az ellenkezőjére fordítjuk azt, amire tervezték.