Конвергентная и дискриминантная валидность
Два взаимно противоположных требования: методика должна согласовываться с тем, с чем должна согласовываться, и оставаться отличимой от того, чем она заявляет, что не является. Большинство слабых методик не справляются со вторым.
Конвергентная и дискриминантная валидность представляют собой две половины одного требования. Мера должна коррелировать с тем, с чем она теоретически должна коррелировать, и не должна слишком сильно коррелировать с тем, от чего она, как предполагается, отличается. Выполнение только одного из этих условий не является частичным успехом; как правило, это признак того, что конструкт не является тем, чем он себя называет.
Конвергентная валидность
Конвергентные данные показывают, что мера согласуется с другими показателями того же самого явления. Новая шкала тревожности должна существенно коррелировать с уже устоявшимися шкалами тревожности, с оценками клиницистов и, в идеале, с чем-то, что не является ещё одним опросником, например с физиологическими показателями или наблюдаемым избегающим поведением.
Обычно здесь ожидаются корреляции выше 0.50, часто выше 0.70, если сравниваемая мера представляет собой хорошо зарекомендовавший себя инструмент для того же конструкта. Ниже этого уровня либо новая шкала, либо сравниваемый инструмент измеряет что-то другое.
Здесь есть ловушка. Корреляция 0.95 с уже существующей шкалой не является триумфом: это означает, что новый инструмент представляет собой переупаковку, и честный вопрос заключается в том, что же он добавляет. Конвергентная валидность, это нижняя планка, а не цель, к максимизации которой нужно стремиться.
Дискриминантная валидность
Дискриминантные данные показывают, что мера остаётся отдельной от конструктов, от которых она, по заявлению, отличается. Именно здесь скрываются самые интересные неудачи.
Эта закономерность повторяется во всей литературе. Упорство коррелирует с добросовестностью примерно на уровне 0.84, что достаточно близко, чтобы метаанализ обнаружил: после контроля добросовестности упорство почти ничего не добавляет к прогнозированию академической успеваемости. Самоотчётный эмоциональный интеллект в значительной степени пересекается с эмоциональной стабильностью, экстраверсией и добросовестностью вместе взятыми. Общая дисперсия внутри Тёмной триады во многом исчезает, если учесть фактор Честность-Скромность из модели HEXACO. В каждом случае конструкт преподносился как новая территория, а оказывался переименованной областью уже существующей карты.
Дискриминантная валидность также является той областью, где проявляются эффекты метода. Если каждый самоотчётный конструкт в исследовании коррелирует на уровне 0.4 с каждым другим, общий фактор, вероятно, отражает стиль ответов респондента, а не какую-либо общую психологию.
Тест, который расставляет всё по местам
Решающей процедурой является инкрементная валидность: сначала в регрессию вводится уже устоявшаяся мера, затем новая, и проверяется, объясняет ли новая мера дополнительную дисперсию результата. Если нет, конструкт всё ещё может представлять теоретический интерес, но инструмент не измеряет ничего такого, чего в данной области уже не было.
Это требовательный стандарт, и очень многие опубликованные шкалы никогда не подвергались этой проверке. Когда её всё же проводят, результатом часто оказывается описанная выше избыточность. Это не скандал, а обычная научная чистка, однако это означает, что популярность конструкта ничего не говорит о том, пройдёт ли он этот тест.
Что это меняет для читателя
Когда тест сообщает несколько баллов, полезный вопрос заключается в том, действительно ли эти баллы различны. Четыре измерения, коррелирующие друг с другом на уровне 0.8, представляют собой одно измерение с четырьмя названиями, и построенный на их основе профиль будет выглядеть дифференцированным, почти не неся при этом независимой информации.
Инструменты, которые публикуют корреляции между своими шкалами, позволяют вам проверить это самостоятельно. Инструменты, которые представляют тип с четырьмя квадрантами, никогда не показывая, как эти квадранты соотносятся друг с другом, делают такую проверку невозможной, и обычно в этом и заключается смысл.
Проверьте это на практике
Читать об измерении, это одно. Увидеть собственный балл с указанием источника, нормативной выборки и ограничений, это другое. Прохождение бесплатно, регистрация не требуется.
Продолжить чтение
- Что такое психометрика?Дисциплина, которая определяет, насколько хорошо психологическое измерение выполняет свою задачу, и причина того, что два теста, задающих похожие вопросы, могут сильно различаться по ценности своих результатов.
- Что такое надёжность в психологическом тестировании?Надёжность, это постоянство измерения, а не его правильность. Тест может быть высоко надёжным и при этом измерять не то, что нужно, поэтому это первый вопрос, который задают, и никогда не последний.
- Что такое валидность в психологическом тестировании?Валидность, это не свойство, которым обладает тест. Это аргументация о том, можно ли считать обоснованной конкретную интерпретацию конкретного балла для конкретной цели, и её нужно выстраивать заново для каждого нового применения.
- Что такое конструктная валидность?Самый сложный вопрос в измерении: существует ли то, что вы измеряете, в том виде, в каком вы это определили, и достигает ли ваша методика именно этого, а не чего-то смежного.
- Что такое альфа Кронбаха и чем она не являетсяСамая часто упоминаемая статистика в психологическом тестировании и самая неправильно понимаемая. Альфа не говорит о том, что шкала одномерна, а высокое значение часто является симптомом, а не достоинством.
- Стандартная ошибка измерения: насколько ваш балл может отличаться от истинного значенияКаждый балл несёт погрешность измерения, и для большинства психологических тестов она шире, чем принято считать. Именно эта величина подсказывает, когда различие реально, а когда это просто шум.
- Нормы и процентили: с чем сравнивается ваш баллНеобработанный балл сам по себе неинтерпретируем. Он приобретает смысл только в сравнении с референтной группой, и то, какая группа использовалась, один из самых значимых и наименее освещаемых фактов о любом тесте.
- Как на самом деле создаётся психометрический тестОт определения конструкта до опубликованных норм этот путь занимает годы и отбрасывает большую часть того, что в него вложено. Знание этих этапов делает очевидным, какие из них были пропущены быстрым онлайн-квизом.
- Что значит, что тест является валидированным?Это слово никем не регулируется и свободно используется продуктами, которые не проделали никакой соответствующей работы. Вот что оно означает, когда действительно что-то значит, и четыре вопроса, которые отличают один случай от другого.
- Почему большинство интернет-тестов личности не являются надёжнымиНе потому, что они нечестны, а потому, что шаги, делающие измерение надёжным, невидимы, дороги и легко пропускаются, а их пропуск никак не меняет внешний вид результата.
- Что может и не может измерить самоотчётОпросники просят вас быть наблюдателем самого себя, а это работает лучше для одних вещей и хуже для других. Понимание того, где метод силён, а где даёт сбои, меняет то, как вы читаете любой результат.
- Что значит, когда тест что-то предсказываетКорреляция 0,30, это весомый результат в исследованиях личности и слабое основание для решения об одном конкретном человеке. Оба утверждения верны, и разрыв между ними является причиной большинства случаев неправильного использования результатов теста.
- Скрининг не является диагностикойСкрининговый опросник создан для того, чтобы выявить как можно больше возможных случаев, принимая высокую долю ложноположительных результатов как цену за это. Восприятие скринингового балла как диагноза искажает саму цель, ради которой он был создан.