Item Response Theory (IRT)
Lord, F. M. · 1980
Även känd som: IRT · Rasch · Rasch Measurement Theory · Latent Trait Theory
Item Response Theory är en familj av matematiska modeller som beskriver förhållandet mellan latenta drag (förmågor, attityder) och svar på testitems, vilket möjliggör urvalsfri itemkalibrering och testfri personmätning. Till skillnad från klassisk testteori modellerar IRT egenskaper på itemnivå (svårighetsgrad, diskrimination, gissningseffekt) och personförmåga på en gemensam skala, vilket ger mätprecisionsuppskattningar vid varje förmågenivå. IRT ligger till grund för modern datoriserad adaptiv testning, storskaliga utbildningsbedömningar (PISA, GRE, GMAT) samt kliniska patientrapporterade utfallsmått.
Metodologiskt (inte innehållsbaserat) ramverk som modellerar sannolikheten för ett svar som en funktion av latent dragnivå och itemparametrar (svårighetsgrad, diskrimination, gissningseffekt). Ligger till grund för adaptiv testning/CAT snarare än ett specifikt instruments innehåll.
- Källa:
- Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems.
Evidens i korthet
- Empiriskt stöd
- Starka belägg
- Replikering
- Väl replikerad
- Tvärkulturell
- Universell
- Metaanalyser
- 10 indexerade
Dessa bedömningar sammanfattar den publicerade litteraturen om teorin, inte kvaliteten på något enskilt test byggt på den. De är redaktionella bedömningar baserade på källorna nedan och förändras när ny evidens tillkommer.
Historisk kontext
IRT:s grunder lades oberoende av varandra av Georg Rasch i Danmark (1960) och Frederic Lord och Allan Birnbaum i USA (1960-talet), där Lord och Novicks bok 'Statistical Theories of Mental Test Scores' från 1968 gav det matematiska grundarbetet. Lords bok 'Applications of Item Response Theory to Practical Testing Problems' från 1980 befäste fältet genom att visa praktiska tillämpningar inom testkonstruktion, ekvivalering och biasdetektering. Teorin fick bred spridning på 1980- och 1990-talen i takt med ökad beräkningskraft, vilket gjorde parameterskattning genomförbar för storskaliga testprogram.
Begrepp
Inga konstrukt dokumenterade ännu.
Instrument
Inga instrument byggda på denna teori ännu.
Test byggda på denna teori
Inga test byggda på denna teori ännu.
Praktiska tillämpningar
IRT är grunden för datoriserad adaptiv testning (CAT), som används i högriskbedömningar som GRE, GMAT, sjuksköterskeexamen NCLEX och det militära testbatteriet CAT-ASVAB, vilket möjliggör kortare men mer precisa tester genom att välja items anpassade till varje testdeltagares förmågenivå. Inom klinisk verksamhet driver IRT initiativet PROMIS (Patient-Reported Outcomes Measurement Information System), vilket möjliggör effektiv mätning av hälsoutfall. IRT-metoder stödjer också ekvivalering av testformer, upptäckt av differentiell itemfunktion (DIF) för rättvisebedömning, samt utveckling av itembanker för standardiserade testprogram världen över.
Hur det mäts
IRT är i sig en mätmetodologi snarare än en substantiell psykologisk teori. Vanliga modeller inkluderar enparametermodellen (1PL/Rasch), tvåparametermodellen (2PL) och treparametermodellen (3PL) för dikotoma items, samt Graded Response Model och Partial Credit Model för polytoma items. Parameterskattning använder maximum likelihood- eller Bayesianska metoder.
Kritik och begränsningar
En central kritik gäller de starka parametriska antaganden som krävs av IRT-modeller (såsom endimensionalitet och lokalt oberoende), vilka kanske inte håller för komplexa psykologiska konstrukt, vilket leder till modellmisspassning. Rasch-modellgemenskapen och den bredare IRT-gemenskapen är fundamentalt oense om huruvida modellen ska anpassas till data (IRT-ansats) eller om data ska uppfylla modellens krav för fundamental mätning (Rasch-ansats). IRT kräver relativt stora urvalsstorlekar för stabil parameterskattning (vanligtvis 200 till 1000+ testdeltagare beroende på modell), vilket begränsar dess tillämplighet för småskaliga bedömningar.
Centrala publikationer
- Lord, F. M.. (1980). Applications of Item Response Theory to Practical Testing Problems.
- Lord, F. M. & Novick, M. R.. (1968). Statistical Theories of Mental Test Scores.
- Rasch, G.. (1960). Probabilistic Models for Some Intelligence and Attainment Tests.
- Hambleton, R. K., Swaminathan, H. & Rogers, H. J.. (1991). Fundamentals of Item Response Theory.
- Embretson, S. E. & Reise, S. P.. (2000). Item Response Theory for Psychologists. 10.4324/9781410605269