Теорія відповіді на пункти тесту
Lord, F. M. · 1980
Також відомо як: IRT · Rasch · Rasch Measurement Theory · Latent Trait Theory
Теорія відповіді на пункти тесту (IRT) є сімейством математичних моделей, що описують зв'язок між латентними рисами (здібностями, настановами) і відповідями на пункти тесту, уможливлюючи калібрування пунктів, незалежне від вибірки, та вимірювання особи, незалежне від тесту. На відміну від класичної теорії тестів, IRT моделює характеристики на рівні пункту (складність, диференційність, вгадування) і здібності особи на спільній шкалі, надаючи оцінки точності вимірювання на кожному рівні здібностей. IRT лежить в основі сучасного комп'ютеризованого адаптивного тестування, масштабних освітніх оцінювань (PISA, GRE, GMAT) і клінічних показників результатів, про які повідомляють пацієнти.
Методологічна (а не змістова щодо рис) рамка, що моделює ймовірність відповіді як функцію рівня латентної риси та параметрів пункту (складність, диференційна здатність, вгадування). Підтримує адаптивне проходження (CAT), а не зміст якогось одного інструменту.
- Джерело:
- Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems.
Докази коротко
- Емпірична підтримка
- Сильні докази
- Реплікація
- Добре відтворюється
- Крос-культурний
- Універсальний
- Метааналізи
- 10 індексовано
Ці оцінки підсумовують опубліковану літературу про теорію, а не якість окремого тесту, створеного на її основі. Це редакційні судження на основі наведених нижче джерел, і вони змінюються в міру накопичення доказів.
Історичний контекст
Основи IRT незалежно один від одного заклали Георг Раш у Данії (1960) та Фредерік Лорд і Аллан Бірнбаум у США (1960-ті), а математичне підґрунтя забезпечила праця Лорда і Новіка 1968 року «Statistical Theories of Mental Test Scores». Праця Лорда 1980 року «Applications of Item Response Theory to Practical Testing Problems» узагальнила розвиток галузі, продемонструвавши практичне застосування в побудові тестів, зрівнюванні та виявленні упередженості. Теорія набула широкого поширення в 1980-1990-х роках зі зростанням обчислювальних потужностей, що зробило оцінювання параметрів можливим для масштабних програм тестування.
Конструкти
Конструкти поки не задокументовано.
Інструменти
Інструментів на основі цієї теорії поки немає.
Тести, побудовані на цій теорії
Тестів на основі цієї теорії поки немає.
Практичне застосування
IRT є основою комп'ютеризованого адаптивного тестування (CAT), яке застосовують у відповідальних оцінюваннях, як-от GRE, GMAT, ліцензійний іспит для медсестер NCLEX і військова батарея CAT-ASVAB; воно дає змогу робити тести коротшими й точнішими, добираючи пункти під рівень здібностей кожного учасника. У клінічній практиці IRT лежить в основі ініціативи PROMIS (Patient-Reported Outcomes Measurement Information System), що забезпечує ефективне вимірювання результатів для здоров'я. Методи IRT також підтримують зрівнювання тестів між формами, виявлення диференційного функціонування пунктів (DIF) для аналізу справедливості та розроблення банків пунктів для стандартизованих програм тестування в усьому світі.
Як це вимірюється
IRT сама є методологією вимірювання, а не змістовною психологічною теорією. До поширених моделей належать одно-, дво- та триапараметричні логістичні моделі (1PL/Rasch, 2PL, 3PL) для дихотомічних пунктів, а також градуйована модель відповідей і модель часткових балів для політомічних пунктів. Оцінювання параметрів використовує методи максимальної правдоподібності або байєсівські методи.
Критика та обмеження
Ключова критика стосується жорстких параметричних припущень, яких вимагають моделі IRT (як-от одновимірність і локальна незалежність). Вони можуть не виконуватися для складних психологічних конструктів, що призводить до неузгодженості моделі з даними. Спільнота моделі Раша та ширша спільнота IRT принципово розходяться в тому, чи слід підганяти модель до даних (підхід IRT), чи дані мають відповідати вимогам моделі для фундаментального вимірювання (підхід Раша). IRT потребує відносно великих вибірок для стабільного оцінювання параметрів (зазвичай 200-1000+ респондентів залежно від моделі), що обмежує її застосовність для невеликих оцінювань.
Ключові публікації
- Lord, F. M.. (1980). Applications of Item Response Theory to Practical Testing Problems.
- Lord, F. M. & Novick, M. R.. (1968). Statistical Theories of Mental Test Scores.
- Rasch, G.. (1960). Probabilistic Models for Some Intelligence and Attainment Tests.
- Hambleton, R. K., Swaminathan, H. & Rogers, H. J.. (1991). Fundamentals of Item Response Theory.
- Embretson, S. E. & Reise, S. P.. (2000). Item Response Theory for Psychologists. 10.4324/9781410605269