noesisnoesis
BlandetSterk evidens

Itemresponsteori

Lord, F. M. · 1980

Også kjent som: IRT · Rasch · Rasch Measurement Theory · Latent Trait Theory

Item Response Theory er en familie av matematiske modeller som beskriver forholdet mellom latente trekk (evner, holdninger) og svar på testledd, og som muliggjør utvalgsuavhengig kalibrering av ledd og testuavhengig måling av personer. I motsetning til klassisk testteori modellerer IRT egenskaper på leddnivå (vanskelighetsgrad, diskriminering, gjetting) og personens evne på en felles skala, og gir estimater for målepresisjon på hvert evnenivå. IRT ligger til grunn for moderne datamaskinbasert adaptiv testing, storskala utdanningskartlegginger (PISA, GRE, GMAT) og kliniske pasientrapporterte utfallsmål.

Metodologisk rammeverk (ikke et rammeverk for trekkinnhold) som modellerer sannsynligheten for et svar som en funksjon av latent trekknivå og leddparametere (vanskelighetsgrad, diskriminering, gjetting). Ligger til grunn for adaptiv gjennomføring/CAT snarere enn for innholdet i et enkelt instrument.

Kilde:
Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems.

Evidens i korte trekk

Empirisk støtte
Sterk evidens
Replikering
Godt replikert
Tverrkulturell
Universell
Metaanalyser
10 indeksert
ForskningsområderPsykometriPedagogisk målingKlinisk kartleggingTestutviklingDatamaskinbasert adaptiv testing

Disse vurderingene oppsummerer den publiserte litteraturen om teorien, ikke kvaliteten på en enkelt test bygget på den. De er redaksjonelle vurderinger basert på kildene nedenfor, og de endres etter hvert som evidensen øker.

Historisk kontekst

Grunnlaget for IRT ble lagt uavhengig av Georg Rasch i Danmark (1960) og Frederic Lord og Allan Birnbaum i USA (1960-tallet), der Lord og Novicks «Statistical Theories of Mental Test Scores» fra 1968 ga det matematiske fundamentet. Lords «Applications of Item Response Theory to Practical Testing Problems» fra 1980 konsoliderte feltet ved å vise praktiske anvendelser i testkonstruksjon, ekvivalering og påvisning av skjevhet. Teorien fikk bred utbredelse på 1980- og 1990-tallet i takt med økende datakraft, som gjorde parameterestimering gjennomførbar for storskala testprogrammer.

Konstrukter

Ingen konstrukter er dokumentert ennå.

Instrumenter

Ingen instrumenter er bygget på denne teorien ennå.

Tester basert på denne teorien

Ingen tester er bygget på denne teorien ennå.

Praktiske anvendelser

IRT er grunnlaget for datamaskinbasert adaptiv testing (CAT), som brukes i kartlegginger med mye på spill, som GRE, GMAT, sykepleierautorisasjonsprøven NCLEX og det militære testbatteriet CAT-ASVAB. Dette muliggjør kortere, men mer presise tester ved å velge ledd tilpasset hver testtakers evnenivå. I klinisk sammenheng ligger IRT til grunn for PROMIS-initiativet (Patient-Reported Outcomes Measurement Information System), som gir effektiv måling av helseutfall. IRT-metoder støtter også ekvivalering mellom testformer, påvisning av differensiell leddfunksjon (DIF) i rettferdighetsanalyser og utvikling av leddbanker for standardiserte testprogrammer verden over.

Hvordan det måles

IRT er i seg selv en målemetodikk snarere enn en substansiell psykologisk teori. Vanlige modeller omfatter logistiske modeller med én parameter (1PL/Rasch), to parametere (2PL) og tre parametere (3PL) for dikotome ledd, samt Graded Response Model og Partial Credit Model for polytome ledd. Parameterestimering skjer med sannsynlighetsmaksimering eller bayesianske metoder.

Kritikk og begrensninger

En sentral kritikk gjelder de sterke parametriske forutsetningene IRT-modeller krever (som endimensjonalitet og lokal uavhengighet), som kanskje ikke holder for komplekse psykologiske konstrukter og dermed fører til dårlig modelltilpasning. Rasch-miljøet og det bredere IRT-miljøet er grunnleggende uenige om hvorvidt modellen skal tilpasses dataene (IRT-tilnærmingen) eller dataene skal oppfylle modellens krav til fundamental måling (Rasch-tilnærmingen). IRT krever relativt store utvalg for stabil parameterestimering (vanligvis 200-1000+ testpersoner avhengig av modellen), noe som begrenser anvendeligheten ved kartlegginger i liten skala.

Sentrale publikasjoner

  • Lord, F. M.. (1980). Applications of Item Response Theory to Practical Testing Problems.
  • Lord, F. M. & Novick, M. R.. (1968). Statistical Theories of Mental Test Scores.
  • Rasch, G.. (1960). Probabilistic Models for Some Intelligence and Attainment Tests.
  • Hambleton, R. K., Swaminathan, H. & Rogers, H. J.. (1991). Fundamentals of Item Response Theory.
  • Embretson, S. E. & Reise, S. P.. (2000). Item Response Theory for Psychologists. 10.4324/9781410605269

Relaterte teorier

Classical Test TheoryRasch Measurement TheoryGeneralizability TheoryLatent Trait TheoryFactor Analysis
Itemresponsteori: definisjon, evidens og hvordan det måles | NOESIS