Как на самом деле создаётся психометрический тест
От определения конструкта до опубликованных норм этот путь занимает годы и отбрасывает большую часть того, что в него вложено. Знание этих этапов делает очевидным, какие из них были пропущены быстрым онлайн-квизом.
Психометрический инструмент, доходящий до публикации, обычно проходит через пять-шесть лет работы и отбрасывает большую часть того, что для него было написано. Эту последовательность стоит знать, потому что каждый её этап соответствует определённому способу, которым тест может оказаться неадекватным.
1. Определение конструкта
Прежде чем будет написан хоть один пункт, конструкт должен быть определён достаточно точно, чтобы можно было сказать, что в него не входит. Это подразумевает определение, описание размерной структуры (одно измерение или несколько, и если несколько, то как они связаны между собой), а также явное указание того, от каких соседних конструктов он должен отличаться.
Пропуск этого этапа является причиной появления большинства избыточных инструментов. Шкала, построенная на интуитивном представлении о понятии, обычно в итоге измеряет уже установленную черту под новым названием.
2. Формирование пула пунктов
Пункты составляются в количестве, значительно превышающем то, что в итоге останется, обычно в три-пять раз больше финального числа. Они берутся из теории, из существующих инструментов, из интервью с людьми, имеющими описываемый опыт, и от экспертов в предметной области.
На этом этапе пул проверяется на охват содержания (охватывает ли он весь конструкт или концентрируется на одной его стороне?), на уровень читаемости, на формулировки, объединяющие два вопроса в один, и на пункты, которые фактически спрашивают о чём-то другом.
3. Пилотаж и отбор
Пул передаётся первой выборке. Анализ на этом этапе носит преимущественно отсеивающий характер.
Пункты почти без вариативности отсеиваются: вопрос, на который все отвечают одинаково, никого не различает. Пункты, слабо коррелирующие с суммарным баллом, отсеиваются. Пункты, дающие перекрёстную нагрузку на более чем один фактор, отсеиваются. Пункты, ведущие себя по-разному в разных демографических группах по причинам, не связанным с самой чертой (дифференциальное функционирование пункта), отсеиваются, и эта проверка одна из тех, что чаще всего пропускают.
То, что остаётся, обычно составляет треть от первоначально написанного.
4. Подтверждение структуры на новой выборке
Это этап, который отделяет серьёзные инструменты от остальных. Факторный анализ на выборке разработки восстановит заложенную в него структуру, ведь пункты и отбирались так, чтобы её дать. Настоящей проверкой служит конфирматорный факторный анализ на независимой выборке.
Очень многие опубликованные шкалы воспроизводят задуманную структуру только на данных, использованных при их создании. Когда кто-то другой собирает новые данные, факторы не воспроизводятся. Такой провал случается достаточно часто, чтобы вопрос «была ли структура подтверждена на независимой выборке?» стал одним из самых эффективных вопросов, которые можно задать о любом инструменте.
5. Накопление доказательств валидности
Корреляции с уже установленными мерами того же конструкта. Корреляции с конструктами, от которых он должен отличаться, и они, конечно, должны быть ниже. Связи со значимыми исходами. Инкрементальная валидность сверх того, что уже существует. Устойчивость при повторном тестировании через интервал, подходящий для данного конструкта.
Этот этап не заканчивается. Он продолжается столько, сколько инструмент находится в использовании, и именно на этом этапе инструменты чаще всего оказываются несостоятельными спустя годы после публикации.
6. Построение норм
Референтная выборка, достаточно большая и достаточно репрезентативная для целевой популяции, стратифицированная там, где черта варьируется по возрасту или полу, документированная с указанием года и страны. Затем периодически повторяемая, потому что нормы со временем смещаются.
7. Перевод, если инструмент будет использоваться в другой стране
Перевод, это не лингвистическое упражнение. Правильная адаптация подразумевает прямой перевод, независимый обратный перевод, экспертную проверку, когнитивные интервью с носителями целевого языка, а затем новое психометрическое исследование на новом языке, проверяющее, сохраняется ли структура и функционируют ли пункты равноценно. Инструмент, переведённый без такого исследования, является непроверенным инструментом на этом языке, какими бы ни были его заслуги в оригинале.
Что это означает для быстрого квиза
Тест, написанный за один вечер, прошёл только второй этап. Он вполне может дать результат, выглядящий убедительно: процентиль и абзац описания. Но именно пропущенные этапы должны были установить, значит ли всё это хоть что-нибудь.
Проверьте это на практике
Читать об измерении, это одно. Увидеть собственный балл с указанием источника, нормативной выборки и ограничений, это другое. Прохождение бесплатно, регистрация не требуется.
Продолжить чтение
- Что такое психометрика?Дисциплина, которая определяет, насколько хорошо психологическое измерение выполняет свою задачу, и причина того, что два теста, задающих похожие вопросы, могут сильно различаться по ценности своих результатов.
- Что такое надёжность в психологическом тестировании?Надёжность, это постоянство измерения, а не его правильность. Тест может быть высоко надёжным и при этом измерять не то, что нужно, поэтому это первый вопрос, который задают, и никогда не последний.
- Что такое валидность в психологическом тестировании?Валидность, это не свойство, которым обладает тест. Это аргументация о том, можно ли считать обоснованной конкретную интерпретацию конкретного балла для конкретной цели, и её нужно выстраивать заново для каждого нового применения.
- Что такое конструктная валидность?Самый сложный вопрос в измерении: существует ли то, что вы измеряете, в том виде, в каком вы это определили, и достигает ли ваша методика именно этого, а не чего-то смежного.
- Конвергентная и дискриминантная валидностьДва взаимно противоположных требования: методика должна согласовываться с тем, с чем должна согласовываться, и оставаться отличимой от того, чем она заявляет, что не является. Большинство слабых методик не справляются со вторым.
- Что такое альфа Кронбаха и чем она не являетсяСамая часто упоминаемая статистика в психологическом тестировании и самая неправильно понимаемая. Альфа не говорит о том, что шкала одномерна, а высокое значение часто является симптомом, а не достоинством.
- Стандартная ошибка измерения: насколько ваш балл может отличаться от истинного значенияКаждый балл несёт погрешность измерения, и для большинства психологических тестов она шире, чем принято считать. Именно эта величина подсказывает, когда различие реально, а когда это просто шум.
- Нормы и процентили: с чем сравнивается ваш баллНеобработанный балл сам по себе неинтерпретируем. Он приобретает смысл только в сравнении с референтной группой, и то, какая группа использовалась, один из самых значимых и наименее освещаемых фактов о любом тесте.
- Что значит, что тест является валидированным?Это слово никем не регулируется и свободно используется продуктами, которые не проделали никакой соответствующей работы. Вот что оно означает, когда действительно что-то значит, и четыре вопроса, которые отличают один случай от другого.
- Почему большинство интернет-тестов личности не являются надёжнымиНе потому, что они нечестны, а потому, что шаги, делающие измерение надёжным, невидимы, дороги и легко пропускаются, а их пропуск никак не меняет внешний вид результата.
- Что может и не может измерить самоотчётОпросники просят вас быть наблюдателем самого себя, а это работает лучше для одних вещей и хуже для других. Понимание того, где метод силён, а где даёт сбои, меняет то, как вы читаете любой результат.
- Что значит, когда тест что-то предсказываетКорреляция 0,30, это весомый результат в исследованиях личности и слабое основание для решения об одном конкретном человеке. Оба утверждения верны, и разрыв между ними является причиной большинства случаев неправильного использования результатов теста.
- Скрининг не является диагностикойСкрининговый опросник создан для того, чтобы выявить как можно больше возможных случаев, принимая высокую долю ложноположительных результатов как цену за это. Восприятие скринингового балла как диагноза искажает саму цель, ради которой он был создан.