Стандартна грешка на измерването: с колко може да се отклонява твоят резултат
Всеки резултат съдържа допустима грешка, а при повечето психологически тестове тя е по-голяма, отколкото хората предполагат. Това е числото, което ти показва кога една разлика е реална и кога е шум.
Стандартната грешка на измерването превръща един абстрактен коефициент на надеждност в нещо конкретно: диапазон "плюс-минус" около даден резултат. Тя отговаря на въпроса, на който повечето екрани с резултати не дават отговор: колко би могъл да се различава този резултат, ако бях направил теста в някой друг следобед?
Формулата е проста. Умножаваш стандартното отклонение на скалата по квадратния корен от едно минус нейната надеждност. За скала със стандартно отклонение 10 и надеждност 0,85, стандартната грешка е около 3,9 точки.
Какво всъщност покрива този диапазон
В около две трети от случаите истинската позиция на човек попада в рамките на една стандартна грешка от неговия наблюдаван резултат. За да имаш около 95 процента увереност, са ти нужни приблизително две стандартни грешки в двете посоки.
Вземи примера по-горе. Някой има резултат 62. 95-процентният интервал се простира от около 54 до 70. Това е прозорец от шестнайсет точки по скала, при която типичната разлика между средното и ясно над средното ниво може да бъде десет точки.
Това не е дефект на конкретния тест. Надеждност от 0,85 е напълно прилична. Това е нормалната прецизност на психологическото измерване и е причината внимателно изготвените отчети да представят диапазони, а не точни стойности.
Последствията, които хората пропускат
Малките разлики между скалите обикновено са безсмислени. Ако твоята екстраверсия е 58, а твоята откритост е 54, честното тълкуване е, че те са неразличими. Интерпретациите на профили, които изграждат разказ от разлики от четири точки, просто четат шум.
Малките промени във времето също обикновено са безсмислени. Повторното правене на тест и изместването с пет точки са в рамките на грешката за повечето инструменти. Истинската промяна на дадена черта се случва с години и се проявява като движение далеч извън диапазона на грешката, а не като няколко точки от месец за месец.
Класиранията засилват проблема. Разлика от няколко сурови точки може да премести някого с десет перцентилни позиции в гъстата среда на разпределението, защото там се намират повечето хора. Перцентилните рангове изглеждат прецизни, но са най-нестабилният начин за изразяване на резултат.
Прецизността не е равномерна по цялата скала. Класическата теория на тестовете предполага една стойност на грешката за всеки резултат, което е опростяване. Теорията за отговора на твърдението моделира грешката отделно за всяко ниво на дадена черта и тя почти винаги е по-голяма в крайностите, точно там, където се правят най-важните интерпретации. Много високият или много ниският резултат обикновено е по-малко прецизен от средния, а не повече.
Защо честното отчитане изглежда по-малко впечатляващо
Инструмент, който отчита доверителни диапазони, изглежда по-неясен от такъв, който отчита едно число до първия знак след десетичната запетая. По-неясният казва истината. Този, който изглежда по-прецизен, има същата скрита грешка, но е избрал да не я показва.
Струва си да имаш това предвид, когато сравняваш научно документиран тест с комерсиален продукт, който те причислява към дадена категория. Границата на категорията се намира на конкретен резултат и някой с една точка под нея и някой с една точка над нея са, статистически погледнато, един и същ човек. Етикетът за тип прикрива това напълно, което е един от по-сериозните аргументи срещу инструментите, базирани на типове, и причината непрекъснатите резултати с посочена грешка да са стандартът в научните изследвания.
Подложи го на тест
Четенето за измерванията е едно. Да видиш собствения си резултат с неговия източник, извадка за норма и ограничения е съвсем друго. Безплатен за попълване, не се изисква регистрация.
Продължи да четеш
- Какво е психометрия?Дисциплината, която установява дали дадено психологическо измерване е добро, и причината два теста, задаващи подобни въпроси, да се различават изключително много по стойността на своите резултати.
- Какво е надеждност в психологическото тестване?Надеждността е съгласуваност на измерването, а не точност. Един тест може да бъде много надежден и въпреки това да измерва грешното нещо, поради което това е първият зададен въпрос, но никога последният.
- Какво е валидност в психологическото тестване?Валидността не е свойство, което един тест притежава. Тя е аргумент за това дали определена интерпретация на даден резултат за определена цел е защитима и трябва да се изгражда наново за всяка нова употреба.
- Какво е конструктна валидност?Най-трудният въпрос при измерването: дали нещото, което измерваш, съществува така, както си го дефинирал, и дали твоят инструмент достига до него, а не до нещо сходно.
- Конвергентна и дискриминантна валидностДве огледални изисквания: един измерител трябва да съответства на това, на което трябва да съответства, и трябва да остане разграничим от това, което твърди, че не е. Повечето слаби инструменти се провалят на второто.
- Какво е алфа на Кронбах и какво не еНай-често отчитаната статистика в психологическото тестване и най-погрешно тълкуваната. Алфа не ти казва, че дадена скала е едноизмерна, а високата стойност често е по-скоро симптом, отколкото предимство.
- Норми и перцентили: с какво се сравнява твоят резултатСуровият резултат не може да се интерпретира сам по себе си. Той придобива смисъл само спрямо референтна група, а коя група е използвана, е един от най-важните и най-слабо огласявани факти за всеки тест.
- Как всъщност се създава един психометричен тестОт дефинирането на конструкта до публикуваните норми, процесът отнема години и отхвърля по-голямата част от това, което е вложено в него. Ако познаваш стъпките, става очевидно кои от тях са пропуснати при един бърз онлайн тест.
- Какво означава, когато един тест се нарича валидиран?Думата е нерегулирана и се използва свободно от продукти, които не са положили нужните усилия. Ето какво означава тя, когато наистина има смисъл, и четирите въпроса, които разграничават двата случая.
- Защо повечето интернет тестове за личността не са надеждниНе защото са нечестни, а защото стъпките, които правят едно измерване надеждно, са невидими, скъпи и лесни за пропускане, а пропускането им не променя с нищо начина, по който изглежда резултатът.
- Какво може и какво не може да измери една самооценкаВъпросниците изискват от теб да бъдеш наблюдател на самия себе си, което работи по-добре за някои неща, отколкото за други. Да знаеш къде методът е силен и къде се проваля, променя начина, по който четеш всеки резултат.
- Какво означава, когато един тест предсказва нещоКорелация от 0,30 е силно откритие в изследванията на личността и слаба основа за решение за един човек. И двете твърдения са верни, а разминаването между тях причинява повечето злоупотреби с резултатите от тестовете.
- Скринингът не е диагнозаСкрининговият въпросник е създаден, за да улови възможно най-много потенциални случаи, приемайки висок процент на фалшиво положителни резултати като цена за това. Интерпретирането на скринингов резултат като диагноза противоречи на целта, за която е създаден.