Teori Respons Item
Lord, F. M. · 1980
Juga dikenali sebagai: IRT · Rasch · Rasch Measurement Theory · Latent Trait Theory
Teori Respons Item ialah sekumpulan model matematik yang menerangkan hubungan antara sifat pendam (kebolehan, sikap) dan respons terhadap item ujian, membolehkan penentukuran item bebas sampel dan pengukuran individu bebas ujian. Tidak seperti Teori Ujian Klasik, IRT memodelkan ciri-ciri peringkat item (kesukaran, diskriminasi, tekaan) dan kebolehan individu pada skala yang sama, serta memberikan anggaran ketepatan pengukuran pada setiap tahap kebolehan. IRT menjadi asas kepada ujian adaptif berkomputer moden, penilaian pendidikan berskala besar (PISA, GRE, GMAT) dan ukuran hasil yang dilaporkan oleh pesakit klinikal.
Kerangka metodologi (bukan kandungan sifat) yang memodelkan kebarangkalian sesuatu jawapan sebagai fungsi tahap sifat pendam dan parameter item (kesukaran, diskriminasi, tekaan). Menyokong pentadbiran ujian adaptif/CAT dan bukan kandungan mana-mana satu instrumen.
- Sumber:
- Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems.
Bukti secara ringkas
- Sokongan empirikal
- Bukti kukuh
- Replikasi
- Direplikasi dengan baik
- Rentas budaya
- Universal
- Meta-analisis
- 10 diindeks
Penarafan ini merumuskan kepustakaan yang diterbitkan mengenai teori tersebut, bukan kualiti mana-mana ujian tunggal yang dibina berdasarkannya. Penarafan ini merupakan pertimbangan editorial berdasarkan sumber yang disenaraikan di bawah, dan akan berubah apabila bukti bertambah.
Konteks Sejarah
Asas IRT diletakkan secara berasingan oleh Georg Rasch di Denmark (1960) serta Frederic Lord dan Allan Birnbaum di Amerika Syarikat (1960-an), dengan karya Lord dan Novick pada tahun 1968, 'Statistical Theories of Mental Test Scores', menyediakan asas matematiknya. Karya Lord pada tahun 1980, 'Applications of Item Response Theory to Practical Testing Problems', mengukuhkan bidang ini dengan menunjukkan aplikasi praktikal dalam pembinaan ujian, penyetaraan dan pengesanan bias. Teori ini diterima pakai secara meluas pada tahun 1980-an hingga 1990-an seiring dengan peningkatan kuasa pengkomputeran, yang menjadikan penganggaran parameter boleh dilaksanakan bagi program ujian berskala besar.
Konstruk
Belum ada konstruk didokumenkan.
Instrumen
Belum ada instrumen dibina berdasarkan teori ini.
Ujian yang dibina berdasarkan teori ini
Belum ada ujian dibina berdasarkan teori ini.
Aplikasi Praktikal
IRT merupakan asas kepada ujian adaptif berkomputer (CAT), yang digunakan dalam penilaian berisiko tinggi seperti GRE, GMAT, peperiksaan pelesenan kejururawatan NCLEX dan bateri ketenteraan CAT-ASVAB, membolehkan ujian yang lebih pendek tetapi lebih tepat dengan memilih item yang disesuaikan dengan tahap kebolehan setiap calon. Dalam persekitaran klinikal, IRT menjadi teras inisiatif PROMIS (Patient-Reported Outcomes Measurement Information System), membolehkan pengukuran hasil kesihatan yang cekap. Kaedah IRT juga menyokong penyetaraan ujian merentas bentuk, pengesanan fungsi item pembeza (DIF) untuk analisis keadilan, dan pembangunan bank item untuk program ujian piawai di seluruh dunia.
Cara Ia Diukur
IRT sendiri ialah metodologi pengukuran dan bukannya teori psikologi yang substantif. Model yang lazim termasuk model logistik satu parameter (1PL/Rasch), dua parameter (2PL) dan tiga parameter (3PL) untuk item dikotomi, serta Graded Response Model dan Partial Credit Model untuk item politomi. Penganggaran parameter menggunakan kaedah kebolehjadian maksimum atau kaedah Bayesian.
Kritikan & Batasan
Kritikan utama ialah andaian parametrik yang kuat yang diperlukan oleh model IRT (seperti keunidimensian dan ketakbersandaran setempat), yang mungkin tidak dipenuhi oleh konstruk psikologi yang kompleks, sehingga menyebabkan ketidaksepadanan model. Komuniti model Rasch dan komuniti IRT yang lebih luas berbeza pendapat secara asas tentang sama ada model perlu disesuaikan dengan data (pendekatan IRT) atau data perlu memenuhi keperluan model untuk pengukuran asas (pendekatan Rasch). IRT memerlukan saiz sampel yang agak besar untuk anggaran parameter yang stabil (lazimnya 200-1000+ peserta bergantung pada model), lalu mengehadkan kebolehgunaannya untuk penilaian berskala kecil.
Penerbitan Utama
- Lord, F. M.. (1980). Applications of Item Response Theory to Practical Testing Problems.
- Lord, F. M. & Novick, M. R.. (1968). Statistical Theories of Mental Test Scores.
- Rasch, G.. (1960). Probabilistic Models for Some Intelligence and Attainment Tests.
- Hambleton, R. K., Swaminathan, H. & Rogers, H. J.. (1991). Fundamentals of Item Response Theory.
- Embretson, S. E. & Reise, S. P.. (2000). Item Response Theory for Psychologists. 10.4324/9781410605269