noesisnoesis
BercampurBukti kukuh

Teori Respons Item

Lord, F. M. · 1980

Juga dikenali sebagai: IRT · Rasch · Rasch Measurement Theory · Latent Trait Theory

Teori Respons Item ialah sekumpulan model matematik yang menerangkan hubungan antara sifat pendam (kebolehan, sikap) dan respons terhadap item ujian, membolehkan penentukuran item bebas sampel dan pengukuran individu bebas ujian. Tidak seperti Teori Ujian Klasik, IRT memodelkan ciri-ciri peringkat item (kesukaran, diskriminasi, tekaan) dan kebolehan individu pada skala yang sama, serta memberikan anggaran ketepatan pengukuran pada setiap tahap kebolehan. IRT menjadi asas kepada ujian adaptif berkomputer moden, penilaian pendidikan berskala besar (PISA, GRE, GMAT) dan ukuran hasil yang dilaporkan oleh pesakit klinikal.

Kerangka metodologi (bukan kandungan sifat) yang memodelkan kebarangkalian sesuatu jawapan sebagai fungsi tahap sifat pendam dan parameter item (kesukaran, diskriminasi, tekaan). Menyokong pentadbiran ujian adaptif/CAT dan bukan kandungan mana-mana satu instrumen.

Sumber:
Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems.

Bukti secara ringkas

Sokongan empirikal
Bukti kukuh
Replikasi
Direplikasi dengan baik
Rentas budaya
Universal
Meta-analisis
10 diindeks
Domain penyelidikanPsikometrikPengukuran pendidikanPenilaian klinikalPembangunan ujianUjian adaptif berkomputer

Penarafan ini merumuskan kepustakaan yang diterbitkan mengenai teori tersebut, bukan kualiti mana-mana ujian tunggal yang dibina berdasarkannya. Penarafan ini merupakan pertimbangan editorial berdasarkan sumber yang disenaraikan di bawah, dan akan berubah apabila bukti bertambah.

Konteks Sejarah

Asas IRT diletakkan secara berasingan oleh Georg Rasch di Denmark (1960) serta Frederic Lord dan Allan Birnbaum di Amerika Syarikat (1960-an), dengan karya Lord dan Novick pada tahun 1968, 'Statistical Theories of Mental Test Scores', menyediakan asas matematiknya. Karya Lord pada tahun 1980, 'Applications of Item Response Theory to Practical Testing Problems', mengukuhkan bidang ini dengan menunjukkan aplikasi praktikal dalam pembinaan ujian, penyetaraan dan pengesanan bias. Teori ini diterima pakai secara meluas pada tahun 1980-an hingga 1990-an seiring dengan peningkatan kuasa pengkomputeran, yang menjadikan penganggaran parameter boleh dilaksanakan bagi program ujian berskala besar.

Konstruk

Belum ada konstruk didokumenkan.

Instrumen

Belum ada instrumen dibina berdasarkan teori ini.

Ujian yang dibina berdasarkan teori ini

Belum ada ujian dibina berdasarkan teori ini.

Aplikasi Praktikal

IRT merupakan asas kepada ujian adaptif berkomputer (CAT), yang digunakan dalam penilaian berisiko tinggi seperti GRE, GMAT, peperiksaan pelesenan kejururawatan NCLEX dan bateri ketenteraan CAT-ASVAB, membolehkan ujian yang lebih pendek tetapi lebih tepat dengan memilih item yang disesuaikan dengan tahap kebolehan setiap calon. Dalam persekitaran klinikal, IRT menjadi teras inisiatif PROMIS (Patient-Reported Outcomes Measurement Information System), membolehkan pengukuran hasil kesihatan yang cekap. Kaedah IRT juga menyokong penyetaraan ujian merentas bentuk, pengesanan fungsi item pembeza (DIF) untuk analisis keadilan, dan pembangunan bank item untuk program ujian piawai di seluruh dunia.

Cara Ia Diukur

IRT sendiri ialah metodologi pengukuran dan bukannya teori psikologi yang substantif. Model yang lazim termasuk model logistik satu parameter (1PL/Rasch), dua parameter (2PL) dan tiga parameter (3PL) untuk item dikotomi, serta Graded Response Model dan Partial Credit Model untuk item politomi. Penganggaran parameter menggunakan kaedah kebolehjadian maksimum atau kaedah Bayesian.

Kritikan & Batasan

Kritikan utama ialah andaian parametrik yang kuat yang diperlukan oleh model IRT (seperti keunidimensian dan ketakbersandaran setempat), yang mungkin tidak dipenuhi oleh konstruk psikologi yang kompleks, sehingga menyebabkan ketidaksepadanan model. Komuniti model Rasch dan komuniti IRT yang lebih luas berbeza pendapat secara asas tentang sama ada model perlu disesuaikan dengan data (pendekatan IRT) atau data perlu memenuhi keperluan model untuk pengukuran asas (pendekatan Rasch). IRT memerlukan saiz sampel yang agak besar untuk anggaran parameter yang stabil (lazimnya 200-1000+ peserta bergantung pada model), lalu mengehadkan kebolehgunaannya untuk penilaian berskala kecil.

Penerbitan Utama

  • Lord, F. M.. (1980). Applications of Item Response Theory to Practical Testing Problems.
  • Lord, F. M. & Novick, M. R.. (1968). Statistical Theories of Mental Test Scores.
  • Rasch, G.. (1960). Probabilistic Models for Some Intelligence and Attainment Tests.
  • Hambleton, R. K., Swaminathan, H. & Rogers, H. J.. (1991). Fundamentals of Item Response Theory.
  • Embretson, S. E. & Reise, S. P.. (2000). Item Response Theory for Psychologists. 10.4324/9781410605269

Teori Berkaitan

Classical Test TheoryRasch Measurement TheoryGeneralizability TheoryLatent Trait TheoryFactor Analysis
Teori Respons Item: definisi, bukti dan cara ia diukur | NOESIS