noesisnoesis
Как работает измерение

Стандартная ошибка измерения: насколько ваш балл может отличаться от истинного значения

Каждый балл несёт погрешность измерения, и для большинства психологических тестов она шире, чем принято считать. Именно эта величина подсказывает, когда различие реально, а когда это просто шум.

Стандартная ошибка измерения превращает абстрактный коэффициент надёжности в нечто конкретное: диапазон плюс-минус вокруг балла. Она отвечает на вопрос, который большинство экранов с результатами оставляют без ответа: насколько могло бы отличаться это число, если бы я проходил тест в другой день?

Формула проста. Умножьте стандартное отклонение шкалы на квадратный корень из единицы минус её надёжность. Для шкалы со стандартным отклонением 10 и надёжностью 0,85 стандартная ошибка составляет около 3,9 балла.

Что на самом деле охватывает этот диапазон

Примерно в двух третях случаев истинное положение человека находится в пределах одной стандартной ошибки от его наблюдаемого балла. Чтобы быть уверенным примерно на 95 процентов, нужно взять примерно две стандартные ошибки в каждую сторону.

Возьмём приведённый выше пример. Кто-то набирает 62 балла. 95-процентный интервал простирается примерно от 54 до 70. Это шестнадцатибалльное окно на шкале, где типичный разрыв между средним и явно выше среднего может составлять всего десять баллов.

Это не недостаток конкретного теста. Надёжность 0,85 это достойный показатель. Такова обычная точность психологических измерений, и именно поэтому в добросовестных отчётах представляют диапазоны, а не точечные значения.

Последствия, которые упускают из виду

Небольшие различия между шкалами обычно не имеют значения. Если ваша экстраверсия равна 58, а открытость новому опыту равна 54, честный вывод состоит в том, что они неразличимы. Интерпретации профиля, строящие повествование на разнице в четыре балла, читают шум, а не сигнал.

Небольшие изменения во времени также обычно не имеют значения. Повторное прохождение теста со сдвигом на пять баллов укладывается в пределы ошибки для большинства инструментов. Реальное изменение черты происходит на протяжении лет и проявляется как сдвиг, выходящий далеко за пределы диапазона ошибки, а не как несколько баллов от месяца к месяцу.

Ранжирование усиливает проблему. Разница в несколько исходных баллов может сдвинуть человека на десять процентильных позиций в плотной середине распределения, потому что именно там находится большинство людей. Процентильные ранги выглядят точными, но являются наименее устойчивым способом выражения балла.

Точность неоднородна по всей шкале. Классическая теория тестов предполагает единое значение ошибки для каждого балла, что является упрощением. Теория ответа на пункт моделирует ошибку отдельно для каждого уровня черты, и она почти всегда больше на крайних значениях, то есть именно там, где делаются наиболее значимые интерпретации. Очень высокий или очень низкий балл, как правило, менее точен, чем средний, а не более.

Почему честная отчётность выглядит менее впечатляюще

Инструмент, который сообщает доверительные диапазоны, выглядит более расплывчатым, чем тот, который приводит одно число с точностью до десятой доли. Расплывчатый говорит правду. Тот, что выглядит точным, имеет ту же основную ошибку, но решил её не показывать.

Это стоит помнить при сравнении научно документированного теста с коммерческим продуктом, который присваивает вам категорию. Граница категории проходит на конкретном балле, и человек на балл ниже неё и человек на балл выше неё, статистически, один и тот же человек. Типовая метка полностью скрывает это, что является одним из более серьёзных аргументов против инструментов, основанных на типах, и причиной, по которой непрерывные баллы с указанной ошибкой являются стандартом в исследованиях.

Проверьте это на практике

Читать об измерении, это одно. Увидеть собственный балл с указанием источника, нормативной выборки и ограничений, это другое. Прохождение бесплатно, регистрация не требуется.

Продолжить чтение