Стандартная ошибка измерения: насколько ваш балл может отличаться от истинного значения
Каждый балл несёт погрешность измерения, и для большинства психологических тестов она шире, чем принято считать. Именно эта величина подсказывает, когда различие реально, а когда это просто шум.
Стандартная ошибка измерения превращает абстрактный коэффициент надёжности в нечто конкретное: диапазон плюс-минус вокруг балла. Она отвечает на вопрос, который большинство экранов с результатами оставляют без ответа: насколько могло бы отличаться это число, если бы я проходил тест в другой день?
Формула проста. Умножьте стандартное отклонение шкалы на квадратный корень из единицы минус её надёжность. Для шкалы со стандартным отклонением 10 и надёжностью 0,85 стандартная ошибка составляет около 3,9 балла.
Что на самом деле охватывает этот диапазон
Примерно в двух третях случаев истинное положение человека находится в пределах одной стандартной ошибки от его наблюдаемого балла. Чтобы быть уверенным примерно на 95 процентов, нужно взять примерно две стандартные ошибки в каждую сторону.
Возьмём приведённый выше пример. Кто-то набирает 62 балла. 95-процентный интервал простирается примерно от 54 до 70. Это шестнадцатибалльное окно на шкале, где типичный разрыв между средним и явно выше среднего может составлять всего десять баллов.
Это не недостаток конкретного теста. Надёжность 0,85 это достойный показатель. Такова обычная точность психологических измерений, и именно поэтому в добросовестных отчётах представляют диапазоны, а не точечные значения.
Последствия, которые упускают из виду
Небольшие различия между шкалами обычно не имеют значения. Если ваша экстраверсия равна 58, а открытость новому опыту равна 54, честный вывод состоит в том, что они неразличимы. Интерпретации профиля, строящие повествование на разнице в четыре балла, читают шум, а не сигнал.
Небольшие изменения во времени также обычно не имеют значения. Повторное прохождение теста со сдвигом на пять баллов укладывается в пределы ошибки для большинства инструментов. Реальное изменение черты происходит на протяжении лет и проявляется как сдвиг, выходящий далеко за пределы диапазона ошибки, а не как несколько баллов от месяца к месяцу.
Ранжирование усиливает проблему. Разница в несколько исходных баллов может сдвинуть человека на десять процентильных позиций в плотной середине распределения, потому что именно там находится большинство людей. Процентильные ранги выглядят точными, но являются наименее устойчивым способом выражения балла.
Точность неоднородна по всей шкале. Классическая теория тестов предполагает единое значение ошибки для каждого балла, что является упрощением. Теория ответа на пункт моделирует ошибку отдельно для каждого уровня черты, и она почти всегда больше на крайних значениях, то есть именно там, где делаются наиболее значимые интерпретации. Очень высокий или очень низкий балл, как правило, менее точен, чем средний, а не более.
Почему честная отчётность выглядит менее впечатляюще
Инструмент, который сообщает доверительные диапазоны, выглядит более расплывчатым, чем тот, который приводит одно число с точностью до десятой доли. Расплывчатый говорит правду. Тот, что выглядит точным, имеет ту же основную ошибку, но решил её не показывать.
Это стоит помнить при сравнении научно документированного теста с коммерческим продуктом, который присваивает вам категорию. Граница категории проходит на конкретном балле, и человек на балл ниже неё и человек на балл выше неё, статистически, один и тот же человек. Типовая метка полностью скрывает это, что является одним из более серьёзных аргументов против инструментов, основанных на типах, и причиной, по которой непрерывные баллы с указанной ошибкой являются стандартом в исследованиях.
Проверьте это на практике
Читать об измерении, это одно. Увидеть собственный балл с указанием источника, нормативной выборки и ограничений, это другое. Прохождение бесплатно, регистрация не требуется.
Продолжить чтение
- Что такое психометрика?Дисциплина, которая определяет, насколько хорошо психологическое измерение выполняет свою задачу, и причина того, что два теста, задающих похожие вопросы, могут сильно различаться по ценности своих результатов.
- Что такое надёжность в психологическом тестировании?Надёжность, это постоянство измерения, а не его правильность. Тест может быть высоко надёжным и при этом измерять не то, что нужно, поэтому это первый вопрос, который задают, и никогда не последний.
- Что такое валидность в психологическом тестировании?Валидность, это не свойство, которым обладает тест. Это аргументация о том, можно ли считать обоснованной конкретную интерпретацию конкретного балла для конкретной цели, и её нужно выстраивать заново для каждого нового применения.
- Что такое конструктная валидность?Самый сложный вопрос в измерении: существует ли то, что вы измеряете, в том виде, в каком вы это определили, и достигает ли ваша методика именно этого, а не чего-то смежного.
- Конвергентная и дискриминантная валидностьДва взаимно противоположных требования: методика должна согласовываться с тем, с чем должна согласовываться, и оставаться отличимой от того, чем она заявляет, что не является. Большинство слабых методик не справляются со вторым.
- Что такое альфа Кронбаха и чем она не являетсяСамая часто упоминаемая статистика в психологическом тестировании и самая неправильно понимаемая. Альфа не говорит о том, что шкала одномерна, а высокое значение часто является симптомом, а не достоинством.
- Нормы и процентили: с чем сравнивается ваш баллНеобработанный балл сам по себе неинтерпретируем. Он приобретает смысл только в сравнении с референтной группой, и то, какая группа использовалась, один из самых значимых и наименее освещаемых фактов о любом тесте.
- Как на самом деле создаётся психометрический тестОт определения конструкта до опубликованных норм этот путь занимает годы и отбрасывает большую часть того, что в него вложено. Знание этих этапов делает очевидным, какие из них были пропущены быстрым онлайн-квизом.
- Что значит, что тест является валидированным?Это слово никем не регулируется и свободно используется продуктами, которые не проделали никакой соответствующей работы. Вот что оно означает, когда действительно что-то значит, и четыре вопроса, которые отличают один случай от другого.
- Почему большинство интернет-тестов личности не являются надёжнымиНе потому, что они нечестны, а потому, что шаги, делающие измерение надёжным, невидимы, дороги и легко пропускаются, а их пропуск никак не меняет внешний вид результата.
- Что может и не может измерить самоотчётОпросники просят вас быть наблюдателем самого себя, а это работает лучше для одних вещей и хуже для других. Понимание того, где метод силён, а где даёт сбои, меняет то, как вы читаете любой результат.
- Что значит, когда тест что-то предсказываетКорреляция 0,30, это весомый результат в исследованиях личности и слабое основание для решения об одном конкретном человеке. Оба утверждения верны, и разрыв между ними является причиной большинства случаев неправильного использования результатов теста.
- Скрининг не является диагностикойСкрининговый опросник создан для того, чтобы выявить как можно больше возможных случаев, принимая высокую долю ложноположительных результатов как цену за это. Восприятие скринингового балла как диагноза искажает саму цель, ради которой он был создан.