Какво е надеждност в психологическото тестване?
Надеждността е съгласуваност на измерването, а не точност. Един тест може да бъде много надежден и въпреки това да измерва грешното нещо, поради което това е първият зададен въпрос, но никога последният.
Надеждността е степента, в която едно измерване е повторяемо, а не просто шум. Ако се претеглиш три пъти в рамките на една минута и получиш 71, 78 и 66 килограма, кантарът би бил ненадежден и не би имал начин да разбереш действителното си тегло от него. Психологическото измерване се сблъсква със същия проблем с много по-непрецизно оборудване.
Важното, което трябва да разбереш за надеждността, е какво тя не твърди. Кантар за баня, който постоянно показва осем килограма повече, е напълно надежден и напълно грешен. Надеждността се отнася до последователността. Дали числото означава правилното нещо, е отделен въпрос, наречен валидност. Надеждността е необходима за валидността, но съвсем не е достатъчна за нея.
Формите, които приема
Вътрешна съгласуваност проверява дали твърденията в дадена скала са съгласувани помежду си. Ако десет въпроса имат за цел да измерят една и съща основна черта, хората, които дават висок резултат на един от тях, би трябвало да са склонни да дават висок резултат и на останалите. Това обикновено се отчита като алфа на Кронбах или, още по-добре, омега на Макдоналд.
Тест-ретест надеждност проверява дали един и същ човек постига сходен резултат при два отделни случая. Това е формата, която е от най-голямо значение за чертите, които по дефиниция би трябвало да са стабилни. Това е и формата, която най-често не се отчита, защото изисква проследяване на същите участници седмици по-късно.
Интер-оценителска надеждност се прилага, когато хора оценяват инструмента: клинични интервюта, проективни техники, наблюдение на поведението. Тя проверява дали двама обучени оценители, които разглеждат един и същ материал, стигат до едно и също заключение.
Надеждност на паралелните форми проверява дали две различни версии на един и същ тест, създадени да бъдат еквивалентни, дават едни и същи резултати. Това има значение навсякъде, където даден тест се провежда повече от веднъж и излагането на твърденията е проблем.
Разчитане на числата
Коефициентите на надеждност варират от 0 до 1. Конвенциите са груби и често се използват неправилно, но най-общо: над 0,90 се изисква, когато даден резултат влияе върху живота на индивида, 0,80 до 0,90 е солидна стойност за повечето приложни цели, 0,70 до 0,80 е приемливо за изследвания и за групови сравнения, а под 0,70 означава, че резултатът съдържа повече шум, отколкото повечето заключения могат да понесат.
Две предупреждения относно тези прагове. Първо, те са конвенции, а не закони: приемливото ниво зависи изцяло от това за какво ще се използва резултатът. Второ, много висока алфа при кратка скала обикновено показва, че твърденията са близки до перифрази едно на друго, което купува съгласуваност с цената на покритие на конструкта. Скала от десет въпроса, които всички питат "организиран ли си?" с малко по-различни думи, ще има превъзходна вътрешна съгласуваност и тесен прочит на добросъвестността.
Какво означава това за твоя собствен резултат
Надеждността се превежда директно в това колко доверие заслужава едно-единствено число. Тест с надеждност 0,85 носи грешка на измерването, достатъчно голяма, че разлика от няколко точки между двама души или между твоя резултат днес и резултата ти миналия месец е много вероятно да бъде шум, а не сигнал.
Това е практическото последствие: добрият инструмент отчита своята надеждност, за да знаеш колко широка е несигурността около твоя резултат. Техническият израз на тази несигурност е стандартната грешка на измерването, която превръща коефициента на надеждност в диапазон плюс-минус около резултата.
Инструмент, който изобщо не отчита стойност за надеждност, не е по-точен поради това. Той просто е отказал да ти каже колко е неточен.
Подложи го на тест
Четенето за измерванията е едно. Да видиш собствения си резултат с неговия източник, извадка за норма и ограничения е съвсем друго. Безплатен за попълване, не се изисква регистрация.
Продължи да четеш
- Какво е психометрия?Дисциплината, която установява дали дадено психологическо измерване е добро, и причината два теста, задаващи подобни въпроси, да се различават изключително много по стойността на своите резултати.
- Какво е валидност в психологическото тестване?Валидността не е свойство, което един тест притежава. Тя е аргумент за това дали определена интерпретация на даден резултат за определена цел е защитима и трябва да се изгражда наново за всяка нова употреба.
- Какво е конструктна валидност?Най-трудният въпрос при измерването: дали нещото, което измерваш, съществува така, както си го дефинирал, и дали твоят инструмент достига до него, а не до нещо сходно.
- Конвергентна и дискриминантна валидностДве огледални изисквания: един измерител трябва да съответства на това, на което трябва да съответства, и трябва да остане разграничим от това, което твърди, че не е. Повечето слаби инструменти се провалят на второто.
- Какво е алфа на Кронбах и какво не еНай-често отчитаната статистика в психологическото тестване и най-погрешно тълкуваната. Алфа не ти казва, че дадена скала е едноизмерна, а високата стойност често е по-скоро симптом, отколкото предимство.
- Стандартна грешка на измерването: с колко може да се отклонява твоят резултатВсеки резултат съдържа допустима грешка, а при повечето психологически тестове тя е по-голяма, отколкото хората предполагат. Това е числото, което ти показва кога една разлика е реална и кога е шум.
- Норми и перцентили: с какво се сравнява твоят резултатСуровият резултат не може да се интерпретира сам по себе си. Той придобива смисъл само спрямо референтна група, а коя група е използвана, е един от най-важните и най-слабо огласявани факти за всеки тест.
- Как всъщност се създава един психометричен тестОт дефинирането на конструкта до публикуваните норми, процесът отнема години и отхвърля по-голямата част от това, което е вложено в него. Ако познаваш стъпките, става очевидно кои от тях са пропуснати при един бърз онлайн тест.
- Какво означава, когато един тест се нарича валидиран?Думата е нерегулирана и се използва свободно от продукти, които не са положили нужните усилия. Ето какво означава тя, когато наистина има смисъл, и четирите въпроса, които разграничават двата случая.
- Защо повечето интернет тестове за личността не са надеждниНе защото са нечестни, а защото стъпките, които правят едно измерване надеждно, са невидими, скъпи и лесни за пропускане, а пропускането им не променя с нищо начина, по който изглежда резултатът.
- Какво може и какво не може да измери една самооценкаВъпросниците изискват от теб да бъдеш наблюдател на самия себе си, което работи по-добре за някои неща, отколкото за други. Да знаеш къде методът е силен и къде се проваля, променя начина, по който четеш всеки резултат.
- Какво означава, когато един тест предсказва нещоКорелация от 0,30 е силно откритие в изследванията на личността и слаба основа за решение за един човек. И двете твърдения са верни, а разминаването между тях причинява повечето злоупотреби с резултатите от тестовете.
- Скринингът не е диагнозаСкрининговият въпросник е създаден, за да улови възможно най-много потенциални случаи, приемайки висок процент на фалшиво положителни резултати като цена за това. Интерпретирането на скринингов резултат като диагноза противоречи на целта, за която е създаден.