Почему большинство интернет-тестов личности не являются надёжными
Не потому, что они нечестны, а потому, что шаги, делающие измерение надёжным, невидимы, дороги и легко пропускаются, а их пропуск никак не меняет внешний вид результата.
Бесплатный тест на личность онлайн и валидированный психометрический инструмент выдают на вид одинаковый результат: балл, процентиль, абзац с описанием вас. Разница целиком заключается в работе, которую не видно на экране с результатами.
Здесь стоит быть точным, потому что привычная формулировка, согласно которой интернет-тесты являются мошенничеством, в основном неверна и не очень полезна. Большинство из них создано людьми без намерения обманывать. Они ненадёжны по структурным причинам.
Что обычно упускают
Анализ пунктов. В правильно построенной шкале большинство черновых пунктов отбрасывается после пилотного исследования: пункты, по которым никто не показывает разброса, пункты, слабо коррелирующие с общим баллом, пункты, нагружающие более одного фактора, пункты, которые ведут себя по-разному в разных возрастных или языковых группах. Тест, написанный и опубликованный без пилотного исследования, сохранил всё, включая пункты, которые не работают.
Независимое структурное подтверждение. Факторный анализ данных, на основе которых была построена шкала, воспроизведёт именно ту структуру, которую вы заложили. Подтверждение этой структуры на новой выборке представляет собой отдельное исследование, и именно на этом этапе проваливается значительная доля шкал.
Нормы. Процентиль должен браться откуда-то. Если сайт не указывает свою референтную популяцию, число выводится либо из данных предыдущих посетителей (самоотобранной группы неизвестного состава), либо вообще ни из чего конкретного.
Данные ретестовой надёжности. Чтобы установить, что через месяц люди получают тот же балл, нужно найти их снова. Практически никто этого не делает, а значит, устойчивость, которую подразумевает слово «черта», не была продемонстрирована.
Стимулы дизайна работают в неверном направлении
Тест, созданный для вовлечения, оптимизирован под иной результат, чем тест, созданный для точности, и эти две цели расходятся предсказуемым образом.
Лестные результаты работают лучше. Результат, который сообщает вам что-то неприятное, реже распространяют дальше, поэтому результаты смещаются к описаниям, в которых каждый узнаёт себя. Это эффект Барнума, продемонстрированный в 1940-х годах и неоднократно воспроизведённый с тех пор: люди оценивают общие описания личности как в высокой степени точные именно в отношении себя.
Типы работают лучше, чем измерения. «Вы Архитектор» распространяется охотнее, чем «вы находитесь на 68-м процентиле по открытости с широким доверительным интервалом». Типы также скрывают ошибку измерения, поскольку человек, оказавшийся на один балл по ту или другую сторону границы категории, получает совершенно разные ярлыки.
Короткое работает лучше, чем адекватное. Каждый дополнительный вопрос теряет часть респондентов, поэтому тесты урезают до длины, максимизирующей завершение прохождения, а не до длины, покрывающей конструкт.
Ничто из этого не является ложью. Это оптимизация под метрику, отличную от точности.
Как определить это за примерно тридцать секунд
Ищите указание на конкретный исходный инструмент с авторами и годом. Ищите указание на то, из какой популяции взяты нормы. Ищите любое признание ограничений или ошибки измерения. Обратите внимание, является ли результат непрерывным баллом или категорией. Обратите внимание, обещает ли та же страница также определить вашу идеальную профессию, партнёра или предназначение в жизни на основе двадцати вопросов.
Тест, который называет свой инструмент, ссылается на источник, указывает свои нормы и говорит, чего он не может сообщить, проделал эту работу. Тест, который не делает ничего из этого, всё же может быть приятным способом провести пять минут, но число, которое он выдаёт, представляет собой лишь украшение.
Каждый инструмент в каталоге NOESIS указывает, какой опубликованный тест он реализует, кто его написал, в каком году, как он оценивается и что его результаты не устанавливают. Именно последний пункт стоит использовать для сравнения.
Проверьте это на практике
Читать об измерении, это одно. Увидеть собственный балл с указанием источника, нормативной выборки и ограничений, это другое. Прохождение бесплатно, регистрация не требуется.
Продолжить чтение
- Что такое психометрика?Дисциплина, которая определяет, насколько хорошо психологическое измерение выполняет свою задачу, и причина того, что два теста, задающих похожие вопросы, могут сильно различаться по ценности своих результатов.
- Что такое надёжность в психологическом тестировании?Надёжность, это постоянство измерения, а не его правильность. Тест может быть высоко надёжным и при этом измерять не то, что нужно, поэтому это первый вопрос, который задают, и никогда не последний.
- Что такое валидность в психологическом тестировании?Валидность, это не свойство, которым обладает тест. Это аргументация о том, можно ли считать обоснованной конкретную интерпретацию конкретного балла для конкретной цели, и её нужно выстраивать заново для каждого нового применения.
- Что такое конструктная валидность?Самый сложный вопрос в измерении: существует ли то, что вы измеряете, в том виде, в каком вы это определили, и достигает ли ваша методика именно этого, а не чего-то смежного.
- Конвергентная и дискриминантная валидностьДва взаимно противоположных требования: методика должна согласовываться с тем, с чем должна согласовываться, и оставаться отличимой от того, чем она заявляет, что не является. Большинство слабых методик не справляются со вторым.
- Что такое альфа Кронбаха и чем она не являетсяСамая часто упоминаемая статистика в психологическом тестировании и самая неправильно понимаемая. Альфа не говорит о том, что шкала одномерна, а высокое значение часто является симптомом, а не достоинством.
- Стандартная ошибка измерения: насколько ваш балл может отличаться от истинного значенияКаждый балл несёт погрешность измерения, и для большинства психологических тестов она шире, чем принято считать. Именно эта величина подсказывает, когда различие реально, а когда это просто шум.
- Нормы и процентили: с чем сравнивается ваш баллНеобработанный балл сам по себе неинтерпретируем. Он приобретает смысл только в сравнении с референтной группой, и то, какая группа использовалась, один из самых значимых и наименее освещаемых фактов о любом тесте.
- Как на самом деле создаётся психометрический тестОт определения конструкта до опубликованных норм этот путь занимает годы и отбрасывает большую часть того, что в него вложено. Знание этих этапов делает очевидным, какие из них были пропущены быстрым онлайн-квизом.
- Что значит, что тест является валидированным?Это слово никем не регулируется и свободно используется продуктами, которые не проделали никакой соответствующей работы. Вот что оно означает, когда действительно что-то значит, и четыре вопроса, которые отличают один случай от другого.
- Что может и не может измерить самоотчётОпросники просят вас быть наблюдателем самого себя, а это работает лучше для одних вещей и хуже для других. Понимание того, где метод силён, а где даёт сбои, меняет то, как вы читаете любой результат.
- Что значит, когда тест что-то предсказываетКорреляция 0,30, это весомый результат в исследованиях личности и слабое основание для решения об одном конкретном человеке. Оба утверждения верны, и разрыв между ними является причиной большинства случаев неправильного использования результатов теста.
- Скрининг не является диагностикойСкрининговый опросник создан для того, чтобы выявить как можно больше возможных случаев, принимая высокую долю ложноположительных результатов как цену за это. Восприятие скринингового балла как диагноза искажает саму цель, ради которой он был создан.