Что такое надёжность в психологическом тестировании?
Надёжность, это постоянство измерения, а не его правильность. Тест может быть высоко надёжным и при этом измерять не то, что нужно, поэтому это первый вопрос, который задают, и никогда не последний.
Надёжность, это степень, в которой измерение воспроизводимо, а не является шумом. Если бы вы взвешивались три раза в течение минуты и получили 71, 78 и 66 килограммов, весы были бы ненадёжны, и у вас не было бы способа узнать по ним свой реальный вес. Психологическое измерение сталкивается с той же проблемой, но при этом использует значительно менее точный инструментарий.
Ключевая вещь, которую нужно понять о надёжности, это то, чего она не утверждает. Напольные весы, которые стабильно показывают на восемь килограммов больше, полностью надёжны и полностью неверны. Надёжность касается согласованности; вопрос о том, означает ли число то, что нужно, это отдельный вопрос, называемый валидностью. Надёжность необходима для валидности, но далеко не достаточна для неё.
Формы, которые она принимает
Внутренняя согласованность отвечает на вопрос, согласуются ли пункты шкалы друг с другом. Если десять вопросов должны измерять одну и ту же лежащую в основе черту, то люди, дающие высокий ответ на один из них, должны, как правило, давать высокие ответы и на другие. Обычно это выражается через альфа Кронбаха или, что лучше, омегу Макдональда.
Ретестовая надёжность отвечает на вопрос, получает ли один и тот же человек схожие баллы в двух разных случаях. Это форма, которая важнее всего для черт, которые по определению должны быть стабильными. Также это форма, которую чаще всего не сообщают, поскольку она требует повторного обращения к тем же участникам спустя несколько недель.
Межэкспертная надёжность применяется, когда инструмент оценивают люди, клинические интервью, проективные методики, наблюдение за поведением. Она отвечает на вопрос, приходят ли два обученных эксперта, рассматривающие один и тот же материал, к одному и тому же выводу.
Надёжность параллельных форм отвечает на вопрос, дают ли две разные версии одного теста, созданные как эквивалентные, одинаковые баллы. Это важно везде, где тест проводится более одного раза и есть опасения по поводу запоминания заданий.
Как читать цифры
Коэффициенты надёжности принимают значения от 0 до 1. Условные границы приблизительны и часто неправильно используются, но в общих чертах: выше 0,90 требуется там, где балл влияет на жизнь отдельного человека, от 0,80 до 0,90, солидный уровень для большинства прикладных задач, от 0,70 до 0,80 приемлем для исследований и сравнения групп, а ниже 0,70 означает, что балл содержит больше шума, чем могут выдержать большинство выводов.
Два предостережения по поводу этих порогов. Во-первых, это условности, а не законы, приемлемый уровень целиком зависит от того, для чего будет использоваться балл. Во-вторых, очень высокая альфа для короткой шкалы обычно указывает на то, что пункты являются почти парафразами друг друга, что даёт согласованность за счёт полноты охвата конструкта. Шкала из десяти вопросов, все из которых спрашивают «организованы ли вы?» немного разными словами, будет иметь превосходную внутреннюю согласованность и узкое представление о добросовестности.
Что это значит для вашего собственного балла
Надёжность напрямую переводится в то, сколько доверия заслуживает отдельное число. Тест с надёжностью 0,85 несёт погрешность измерения, достаточно большую, чтобы разница в несколько баллов между двумя людьми или между вашим баллом сегодня и вашим баллом месяц назад с высокой вероятностью была шумом, а не сигналом.
В этом заключается практическое следствие: хороший инструмент сообщает свою надёжность, чтобы вы знали, насколько широк диапазон неопределённости вокруг вашего балла. Техническое выражение этой неопределённости, стандартная ошибка измерения, которая переводит коэффициент надёжности в диапазон плюс-минус вокруг балла.
Инструмент, который вообще не сообщает показатель надёжности, из-за этого не становится более точным. Он просто отказался сообщить вам, насколько он неточен.
Проверьте это на практике
Читать об измерении, это одно. Увидеть собственный балл с указанием источника, нормативной выборки и ограничений, это другое. Прохождение бесплатно, регистрация не требуется.
Продолжить чтение
- Что такое психометрика?Дисциплина, которая определяет, насколько хорошо психологическое измерение выполняет свою задачу, и причина того, что два теста, задающих похожие вопросы, могут сильно различаться по ценности своих результатов.
- Что такое валидность в психологическом тестировании?Валидность, это не свойство, которым обладает тест. Это аргументация о том, можно ли считать обоснованной конкретную интерпретацию конкретного балла для конкретной цели, и её нужно выстраивать заново для каждого нового применения.
- Что такое конструктная валидность?Самый сложный вопрос в измерении: существует ли то, что вы измеряете, в том виде, в каком вы это определили, и достигает ли ваша методика именно этого, а не чего-то смежного.
- Конвергентная и дискриминантная валидностьДва взаимно противоположных требования: методика должна согласовываться с тем, с чем должна согласовываться, и оставаться отличимой от того, чем она заявляет, что не является. Большинство слабых методик не справляются со вторым.
- Что такое альфа Кронбаха и чем она не являетсяСамая часто упоминаемая статистика в психологическом тестировании и самая неправильно понимаемая. Альфа не говорит о том, что шкала одномерна, а высокое значение часто является симптомом, а не достоинством.
- Стандартная ошибка измерения: насколько ваш балл может отличаться от истинного значенияКаждый балл несёт погрешность измерения, и для большинства психологических тестов она шире, чем принято считать. Именно эта величина подсказывает, когда различие реально, а когда это просто шум.
- Нормы и процентили: с чем сравнивается ваш баллНеобработанный балл сам по себе неинтерпретируем. Он приобретает смысл только в сравнении с референтной группой, и то, какая группа использовалась, один из самых значимых и наименее освещаемых фактов о любом тесте.
- Как на самом деле создаётся психометрический тестОт определения конструкта до опубликованных норм этот путь занимает годы и отбрасывает большую часть того, что в него вложено. Знание этих этапов делает очевидным, какие из них были пропущены быстрым онлайн-квизом.
- Что значит, что тест является валидированным?Это слово никем не регулируется и свободно используется продуктами, которые не проделали никакой соответствующей работы. Вот что оно означает, когда действительно что-то значит, и четыре вопроса, которые отличают один случай от другого.
- Почему большинство интернет-тестов личности не являются надёжнымиНе потому, что они нечестны, а потому, что шаги, делающие измерение надёжным, невидимы, дороги и легко пропускаются, а их пропуск никак не меняет внешний вид результата.
- Что может и не может измерить самоотчётОпросники просят вас быть наблюдателем самого себя, а это работает лучше для одних вещей и хуже для других. Понимание того, где метод силён, а где даёт сбои, меняет то, как вы читаете любой результат.
- Что значит, когда тест что-то предсказываетКорреляция 0,30, это весомый результат в исследованиях личности и слабое основание для решения об одном конкретном человеке. Оба утверждения верны, и разрыв между ними является причиной большинства случаев неправильного использования результатов теста.
- Скрининг не является диагностикойСкрининговый опросник создан для того, чтобы выявить как можно больше возможных случаев, принимая высокую долю ложноположительных результатов как цену за это. Восприятие скринингового балла как диагноза искажает саму цель, ради которой он был создан.