Что такое валидность в психологическом тестировании?
Валидность, это не свойство, которым обладает тест. Это аргументация о том, можно ли считать обоснованной конкретную интерпретацию конкретного балла для конкретной цели, и её нужно выстраивать заново для каждого нового применения.
Валидность, это вопрос о том, измеряет ли тест то, что заявлено, и обоснованны ли выводы, которые люди делают на основе его баллов. Это центральный вопрос психометрики, и именно на него чаще всего отвечают маркетинговым заявлением, а не доказательствами.
Современное понимание, устоявшееся со времён работ Мессика в 1980-х годах, состоит в том, что валидность не является постоянным атрибутом инструмента. Это свойство интерпретации баллов для конкретного применения. Один и тот же опросник может быть хорошо валидирован для описания самовосприятия человека и совершенно не валидирован для принятия решения о его найме. Утверждение «этот тест валиден» без уточнения, валиден для чего, не является доказательным заявлением; это лозунг.
Виды доказательств
Валидность строится на накопленных доказательствах нескольких типов. В более старых текстах они представлены как отдельные виды валидности; современный взгляд рассматривает их как разные аргументы, поддерживающие единую позицию.
Доказательства содержания отвечают на вопрос, охватывают ли пункты конструкт должным образом. Шкала депрессии, включающая вопросы только о сне и аппетите, охватывает соматические симптомы, но упускает настроение и когнитивные аспекты. Полноту содержания обычно оценивают эксперты в предметной области, и именно поэтому очень короткие шкалы всегда представляют собой компромисс.
Доказательства внутренней структуры отвечают на вопрос, группируются ли пункты так, как предполагает теория. Если модель заявляет четыре отдельные грани, факторный анализ должен выявить четыре фактора, причём важно, чтобы это подтвердилось на независимой выборке, а не только на той, на которой шкала была разработана. Очень многие инструменты воспроизводят задуманную структуру на выборке разработки и не воспроизводят её ни на какой другой.
Связи с другими переменными, область, где происходит основная работа. Конвергентные доказательства показывают, что шкала коррелирует с тем, с чем должна коррелировать. Дискриминантные доказательства показывают, что она не коррелирует слишком сильно с тем, от чего должна отличаться, это хронически игнорируемое требование, и именно оно подрывает множество недавно запатентованных конструктов. Критериальные доказательства показывают, что балл связан со значимым исходом, измеренным одновременно или предсказанным заранее.
Доказательства последствий отвечают на вопрос о том, что происходит при использовании теста. Если инструмент систематически ставит в неблагоприятное положение какую-либо группу по причинам, не связанным с конструктом, это проблема валидности, а не только этическая проблема.
Вопрос, который разоблачает большинство заявлений
Самая острая проверка заявления о валидности, это инкрементная валидность: добавляет ли данный инструмент что-то сверх того, что уже сообщает более дешёвая, старая, устоявшаяся методика?
Поразительное число запатентованных конструктов не проходят эту проверку. Они коррелируют на уровне 0,7 или выше с уже существующим доменом Big Five, предсказывают те же исходы с той же величиной эффекта и не добавляют ничего, если статистически контролировать более старую методику. Конструкт новый; измерение, нет. Именно поэтому разделы критики в серьёзной документации по инструментам так часто касаются избыточности, а не неточности.
На что обращать внимание
Когда кто-то заявляет, что тест валидирован, полезные вопросы конкретны. Валидирован против какого критерия? На какой популяции, какого размера? Была ли факторная структура подтверждена на независимой выборке? Есть ли опубликованные доказательства от исследователей, не имеющих коммерческого интереса в результате? Добавляет ли он что-то сверх устоявшейся альтернативы?
Инструмент с честными ответами на эти вопросы стоит воспринимать серьёзно, включая его ограничения. Инструмент, чья валидация состоит из страницы отзывов и заявления о том, что его прошли миллионы людей, отвечает на совершенно другой вопрос: популярность, не доказательство, и число людей, прошедших тест, ничего не говорит о том, означают ли его баллы что-либо.
Проверьте это на практике
Читать об измерении, это одно. Увидеть собственный балл с указанием источника, нормативной выборки и ограничений, это другое. Прохождение бесплатно, регистрация не требуется.
Продолжить чтение
- Что такое психометрика?Дисциплина, которая определяет, насколько хорошо психологическое измерение выполняет свою задачу, и причина того, что два теста, задающих похожие вопросы, могут сильно различаться по ценности своих результатов.
- Что такое надёжность в психологическом тестировании?Надёжность, это постоянство измерения, а не его правильность. Тест может быть высоко надёжным и при этом измерять не то, что нужно, поэтому это первый вопрос, который задают, и никогда не последний.
- Что такое конструктная валидность?Самый сложный вопрос в измерении: существует ли то, что вы измеряете, в том виде, в каком вы это определили, и достигает ли ваша методика именно этого, а не чего-то смежного.
- Конвергентная и дискриминантная валидностьДва взаимно противоположных требования: методика должна согласовываться с тем, с чем должна согласовываться, и оставаться отличимой от того, чем она заявляет, что не является. Большинство слабых методик не справляются со вторым.
- Что такое альфа Кронбаха и чем она не являетсяСамая часто упоминаемая статистика в психологическом тестировании и самая неправильно понимаемая. Альфа не говорит о том, что шкала одномерна, а высокое значение часто является симптомом, а не достоинством.
- Стандартная ошибка измерения: насколько ваш балл может отличаться от истинного значенияКаждый балл несёт погрешность измерения, и для большинства психологических тестов она шире, чем принято считать. Именно эта величина подсказывает, когда различие реально, а когда это просто шум.
- Нормы и процентили: с чем сравнивается ваш баллНеобработанный балл сам по себе неинтерпретируем. Он приобретает смысл только в сравнении с референтной группой, и то, какая группа использовалась, один из самых значимых и наименее освещаемых фактов о любом тесте.
- Как на самом деле создаётся психометрический тестОт определения конструкта до опубликованных норм этот путь занимает годы и отбрасывает большую часть того, что в него вложено. Знание этих этапов делает очевидным, какие из них были пропущены быстрым онлайн-квизом.
- Что значит, что тест является валидированным?Это слово никем не регулируется и свободно используется продуктами, которые не проделали никакой соответствующей работы. Вот что оно означает, когда действительно что-то значит, и четыре вопроса, которые отличают один случай от другого.
- Почему большинство интернет-тестов личности не являются надёжнымиНе потому, что они нечестны, а потому, что шаги, делающие измерение надёжным, невидимы, дороги и легко пропускаются, а их пропуск никак не меняет внешний вид результата.
- Что может и не может измерить самоотчётОпросники просят вас быть наблюдателем самого себя, а это работает лучше для одних вещей и хуже для других. Понимание того, где метод силён, а где даёт сбои, меняет то, как вы читаете любой результат.
- Что значит, когда тест что-то предсказываетКорреляция 0,30, это весомый результат в исследованиях личности и слабое основание для решения об одном конкретном человеке. Оба утверждения верны, и разрыв между ними является причиной большинства случаев неправильного использования результатов теста.
- Скрининг не является диагностикойСкрининговый опросник создан для того, чтобы выявить как можно больше возможных случаев, принимая высокую долю ложноположительных результатов как цену за это. Восприятие скринингового балла как диагноза искажает саму цель, ради которой он был создан.