noesisnoesis
BlandetStærk evidens

Item response-teori

Lord, F. M. · 1980

Også kendt som: IRT · Rasch · Rasch Measurement Theory · Latent Trait Theory

Item Response Theory er en familie af matematiske modeller, der beskriver sammenhængen mellem latente træk (evner, holdninger) og svar på testitems, hvilket muliggør stikprøveuafhængig kalibrering af items og testuafhængig måling af personer. I modsætning til klassisk testteori modellerer IRT egenskaber på itemniveau (sværhedsgrad, diskrimination, gætning) og personens evne på en fælles skala og giver estimater af målepræcisionen på hvert evneniveau. IRT ligger til grund for moderne computeriseret adaptiv testning, storskala uddannelsesvurderinger (PISA, GRE, GMAT) og kliniske patientrapporterede udfaldsmål.

Metodologisk (ikke trækindholdsmæssig) ramme, der modellerer sandsynligheden for et svar som funktion af det latente trækniveau og itemparametre (sværhedsgrad, diskrimination, gætning). Understøtter adaptiv/CAT-gennemførelse snarere end indholdet i et enkelt instrument.

Kilde:
Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems.

Evidensen i overblik

Empirisk støtte
Stærk evidens
Replikation
Godt replikeret
Tværkulturel
Universel
Metaanalyser
10 indekseret
ForskningsområderPsykometriPædagogisk målingKlinisk vurderingTestudviklingComputeradaptiv testning

Disse vurderinger opsummerer den publicerede litteratur om teorien, ikke kvaliteten af en enkelt test bygget på den. De er redaktionelle vurderinger baseret på kilderne nedenfor, og de ændres, efterhånden som evidensen vokser.

Historisk kontekst

Grundlaget for IRT blev lagt uafhængigt af Georg Rasch i Danmark (1960) og Frederic Lord og Allan Birnbaum i USA (1960'erne), mens Lord og Novicks "Statistical Theories of Mental Test Scores" fra 1968 leverede det matematiske fundament. Lords "Applications of Item Response Theory to Practical Testing Problems" fra 1980 konsoliderede feltet ved at demonstrere praktiske anvendelser inden for testkonstruktion, ækvivalering og påvisning af bias. Teorien vandt bred udbredelse i 1980'erne og 1990'erne i takt med stigende regnekraft, som gjorde parameterestimering mulig for storskala testprogrammer.

Konstrukter

Ingen konstrukter dokumenteret endnu.

Instrumenter

Ingen instrumenter bygget på denne teori endnu.

Test baseret på denne teori

Ingen test bygget på denne teori endnu.

Praktiske anvendelser

IRT er grundlaget for computeriseret adaptiv testning (CAT), som anvendes i vurderinger med store konsekvenser såsom GRE, GMAT, autorisationseksamenen for sygeplejersker NCLEX og det militære testbatteri CAT-ASVAB. Det muliggør kortere og samtidig mere præcise test ved at udvælge items, der er tilpasset hver testpersons evneniveau. I kliniske sammenhænge driver IRT initiativet PROMIS (Patient-Reported Outcomes Measurement Information System), der muliggør effektiv måling af helbredsudfald. IRT-metoder understøtter også ækvivalering af testformer, påvisning af differential item functioning (DIF) i fairnessanalyser og udvikling af itembanker til standardiserede testprogrammer verden over.

Sådan måles det

IRT er i sig selv en målemetodologi snarere end en indholdsmæssig psykologisk teori. Almindelige modeller omfatter de logistiske en-parameter- (1PL/Rasch), to-parameter- (2PL) og tre-parametermodeller (3PL) for dikotome items samt Graded Response Model og Partial Credit Model for polytome items. Parameterestimering foretages med maximum likelihood eller bayesianske metoder.

Kritik og begrænsninger

En vigtig kritik er de stærke parametriske antagelser, som IRT-modeller kræver (såsom unidimensionalitet og lokal uafhængighed), og som muligvis ikke holder for komplekse psykologiske konstrukter, hvilket fører til dårlig modeltilpasning. Rasch-miljøet og det bredere IRT-miljø er grundlæggende uenige om, hvorvidt modellen skal tilpasses data (IRT-tilgangen), eller om data skal opfylde modellens krav til fundamental måling (Rasch-tilgangen). IRT kræver relativt store stikprøver for stabil parameterestimering (typisk 200-1000+ testpersoner afhængigt af modellen), hvilket begrænser anvendeligheden ved vurderinger i lille skala.

Centrale publikationer

  • Lord, F. M.. (1980). Applications of Item Response Theory to Practical Testing Problems.
  • Lord, F. M. & Novick, M. R.. (1968). Statistical Theories of Mental Test Scores.
  • Rasch, G.. (1960). Probabilistic Models for Some Intelligence and Attainment Tests.
  • Hambleton, R. K., Swaminathan, H. & Rogers, H. J.. (1991). Fundamentals of Item Response Theory.
  • Embretson, S. E. & Reise, S. P.. (2000). Item Response Theory for Psychologists. 10.4324/9781410605269

Relaterede teorier

Classical Test TheoryRasch Measurement TheoryGeneralizability TheoryLatent Trait TheoryFactor Analysis
Item response-teori: definition, evidens og hvordan det måles | NOESIS