Теория выборочного ответа (IRT)
Lord, F. M. · 1980
Также известна как: IRT · Rasch · Rasch Measurement Theory · Latent Trait Theory
Теория выборочного ответа (IRT), семейство математических моделей, описывающих связь между латентными чертами (способностями, установками) и ответами на пункты теста, что позволяет проводить калибровку пунктов, независимую от выборки, и измерение человека, независимое от конкретного теста. В отличие от классической теории тестов, IRT моделирует характеристики на уровне пунктов (трудность, дискриминативность, угадывание) и способность человека на общей шкале, обеспечивая оценки точности измерения на каждом уровне способностей. IRT лежит в основе современного компьютерного адаптивного тестирования, масштабных образовательных оценок (PISA, GRE, GMAT) и клинических показателей, сообщаемых пациентами.
Методологическая (а не содержательно-черточная) модель, описывающая вероятность ответа как функцию уровня латентной черты и параметров пункта (трудность, дискриминативность, вероятность угадывания). Служит основой для адаптивного (CAT) предъявления, а не для содержания какого-либо отдельного инструмента.
- Источник:
- Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems.
Доказательная база вкратце
- Эмпирическая поддержка
- Убедительные доказательства
- Воспроизводимость
- Хорошо воспроизведено
- Кросс-культурность
- Универсально
- Метаанализы
- 10 в базе
Эти оценки обобщают опубликованную литературу по теории, а не качество какого-либо конкретного теста, построенного на её основе. Это редакционные суждения, основанные на источниках, перечисленных ниже, и они меняются по мере накопления доказательств.
Исторический контекст
Основы IRT были заложены независимо Георгом Рашем в Дании (1960) и Фредериком Лордом и Алланом Бирнбаумом в США (1960-е), а книга Лорда и Новика 1968 года «Statistical Theories of Mental Test Scores» дала математическую основу. Книга Лорда 1980 года «Applications of Item Response Theory to Practical Testing Problems» консолидировала эту область, продемонстрировав практическое применение в конструировании тестов, эквивалентировании и выявлении смещений. Теория получила широкое распространение в 1980-1990-х годах вместе с ростом вычислительных мощностей, что сделало оценку параметров возможной для масштабных программ тестирования.
Конструкты
Конструкты ещё не документированы.
Инструменты
Инструменты на основе этой теории ещё не созданы.
Тесты, построенные на этой теории
Тесты на основе этой теории ещё не созданы.
Практическое применение
IRT является основой компьютерного адаптивного тестирования (CAT), используемого в тестах с высокими ставками, таких как GRE, GMAT, экзамен на получение лицензии медсестры NCLEX и военная батарея CAT-ASVAB, позволяя проводить более короткие, но более точные тесты за счёт подбора пунктов под уровень способностей каждого испытуемого. В клинических условиях IRT лежит в основе инициативы PROMIS (Patient-Reported Outcomes Measurement Information System), обеспечивая эффективное измерение результатов, сообщаемых пациентами о состоянии здоровья. Методы IRT также поддерживают эквивалентирование тестовых форм, выявление дифференциального функционирования пунктов (DIF) для анализа справедливости и разработку банков пунктов для программ стандартизированного тестирования по всему миру.
Как это измеряется
IRT сама по себе является методологией измерения, а не содержательной психологической теорией. Распространённые модели включают одно-, двух- и трёхпараметрические логистические модели (1PL/Раш, 2PL, 3PL) для дихотомических пунктов, а также модель градуированного ответа и модель частичного балла для политомических пунктов. Оценка параметров использует методы максимального правдоподобия или байесовские методы.
Критика и ограничения
Ключевая критика касается строгих параметрических допущений, требуемых моделями IRT (таких как одномерность и локальная независимость), которые могут не выполняться для сложных психологических конструктов, что приводит к несоответствию модели данным. Сообщество модели Раша и более широкое сообщество IRT принципиально не согласны в том, должна ли модель подгоняться под данные (подход IRT) или данные должны соответствовать требованиям модели для фундаментального измерения (подход Раша). IRT требует относительно больших размеров выборки для устойчивой оценки параметров (обычно от 200 до 1000+ испытуемых в зависимости от модели), что ограничивает её применимость для небольших оценок.
Ключевые публикации
- Lord, F. M.. (1980). Applications of Item Response Theory to Practical Testing Problems.
- Lord, F. M. & Novick, M. R.. (1968). Statistical Theories of Mental Test Scores.
- Rasch, G.. (1960). Probabilistic Models for Some Intelligence and Attainment Tests.
- Hambleton, R. K., Swaminathan, H. & Rogers, H. J.. (1991). Fundamentals of Item Response Theory.
- Embretson, S. E. & Reise, S. P.. (2000). Item Response Theory for Psychologists. 10.4324/9781410605269