noesisnoesis
Hỗn hợpBằng chứng mạnh

Lý thuyết Đáp ứng Câu hỏi (IRT)

Lord, F. M. · 1980

Còn được gọi là: IRT · Rasch · Rasch Measurement Theory · Latent Trait Theory

Lý thuyết Đáp ứng Câu hỏi là một họ các mô hình toán học mô tả mối quan hệ giữa các đặc điểm tiềm ẩn (năng lực, thái độ) và các phản hồi đối với các câu hỏi trắc nghiệm, cho phép hiệu chuẩn câu hỏi không phụ thuộc mẫu và đo lường cá nhân không phụ thuộc bài trắc nghiệm. Không giống Thuyết Trắc nghiệm Cổ điển, IRT mô hình hóa các đặc điểm cấp câu hỏi (độ khó, độ phân biệt, khả năng đoán mò) và năng lực cá nhân trên một thang đo chung, cung cấp các ước tính độ chính xác đo lường ở mỗi mức năng lực. IRT là nền tảng của trắc nghiệm thích ứng trên máy tính hiện đại, các bài đánh giá giáo dục quy mô lớn (PISA, GRE, GMAT), và các thước đo kết quả do bệnh nhân báo cáo trong lâm sàng.

Khung phương pháp luận (không phải nội dung đặc điểm) mô hình hóa xác suất của một phản hồi như một hàm của mức độ đặc điểm tiềm ẩn và các tham số câu hỏi (độ khó, độ phân biệt, khả năng đoán mò). Đây là nền tảng cho việc thực hiện trắc nghiệm thích ứng/CAT chứ không phải nội dung của bất kỳ công cụ cụ thể nào.

Nguồn:
Lord, F. M. (1980). Applications of Item Response Theory to Practical Testing Problems.

Bằng chứng tổng quan

Minh chứng thực nghiệm
Bằng chứng mạnh
Khả năng tái lập
Đã được tái lập tốt
Đa văn hóa
Phổ quát
Các phân tích tổng hợp
10 mục
Các lĩnh vực nghiên cứuTrắc lượng tâm lýĐo lường giáo dụcĐánh giá lâm sàngPhát triển bài trắc nghiệmTrắc nghiệm thích ứng trên máy tính

Những đánh giá này tóm tắt tài liệu nghiên cứu đã công bố về lý thuyết, không phải chất lượng của bất kỳ bài trắc nghiệm cụ thể nào dựa trên lý thuyết đó. Đây là các nhận định biên tập dựa trên các nguồn được liệt kê dưới đây, và có thể thay đổi khi có thêm bằng chứng mới.

Bối Cảnh Lịch Sử

Nền tảng của IRT được đặt ra độc lập bởi Georg Rasch ở Đan Mạch (1960) và Frederic Lord cùng Allan Birnbaum ở Hoa Kỳ (thập niên 1960), với cuốn 'Statistical Theories of Mental Test Scores' năm 1968 của Lord và Novick cung cấp nền tảng toán học. Cuốn 'Applications of Item Response Theory to Practical Testing Problems' năm 1980 của Lord đã củng cố lĩnh vực này bằng cách chứng minh các ứng dụng thực tiễn trong xây dựng bài trắc nghiệm, cân bằng điểm số (equating) và phát hiện thiên lệch. Thuyết được áp dụng rộng rãi vào thập niên 1980-1990 khi năng lực tính toán tăng lên, khiến việc ước lượng tham số trở nên khả thi cho các chương trình trắc nghiệm quy mô lớn.

Cấu trúc

Chưa có cấu trúc khái niệm nào được ghi nhận.

Công cụ

Chưa có công cụ đo nào được xây dựng dựa trên lý thuyết này.

Các bài trắc nghiệm được xây dựng dựa trên lý thuyết này

Chưa có bài trắc nghiệm nào được xây dựng dựa trên lý thuyết này.

Ứng Dụng Thực Tiễn

IRT là nền tảng của trắc nghiệm thích ứng trên máy tính (CAT), được sử dụng trong các bài đánh giá có tính quyết định cao như GRE, GMAT, kỳ thi cấp phép điều dưỡng NCLEX, và bộ trắc nghiệm quân sự CAT-ASVAB, cho phép các bài trắc nghiệm ngắn hơn nhưng chính xác hơn bằng cách chọn các câu hỏi phù hợp với mức năng lực của từng thí sinh. Trong bối cảnh lâm sàng, IRT là động lực cho sáng kiến PROMIS (Hệ thống Thông tin Đo lường Kết quả do Bệnh nhân Báo cáo), cho phép đo lường hiệu quả các kết quả sức khỏe. Các phương pháp IRT cũng hỗ trợ cân bằng điểm số (equating) giữa các phiên bản bài trắc nghiệm, phát hiện chức năng câu hỏi khác biệt (DIF) để phân tích công bằng, và phát triển ngân hàng câu hỏi cho các chương trình trắc nghiệm chuẩn hóa trên toàn thế giới.

Cách Đo Lường

Bản thân IRT là một phương pháp luận đo lường chứ không phải một thuyết tâm lý học thực chất. Các mô hình phổ biến bao gồm mô hình logistic một tham số (1PL/Rasch), hai tham số (2PL) và ba tham số (3PL) cho các câu hỏi nhị phân, và Mô hình Đáp ứng theo Bậc và Mô hình Điểm từng phần cho các câu hỏi đa phân. Việc ước lượng tham số sử dụng phương pháp hợp lý cực đại hoặc phương pháp Bayes.

Phê Bình & Hạn Chế

Một sự chỉ trích quan trọng là các giả định tham số mạnh mẽ mà các mô hình IRT yêu cầu (như tính đơn chiều và độc lập cục bộ), có thể không đúng đối với các cấu trúc tâm lý phức tạp, dẫn đến sự không khớp mô hình. Cộng đồng mô hình Rasch và cộng đồng IRT rộng hơn bất đồng cơ bản về việc liệu mô hình nên được khớp với dữ liệu (cách tiếp cận IRT) hay dữ liệu nên đáp ứng các yêu cầu của mô hình để đo lường cơ bản (cách tiếp cận Rasch). IRT đòi hỏi kích thước mẫu tương đối lớn để ước lượng tham số ổn định (thường là 200-1000+ thí sinh tùy theo mô hình), hạn chế khả năng áp dụng của nó cho các đánh giá quy mô nhỏ.

Ấn Phẩm Tiêu Biểu

  • Lord, F. M.. (1980). Applications of Item Response Theory to Practical Testing Problems.
  • Lord, F. M. & Novick, M. R.. (1968). Statistical Theories of Mental Test Scores.
  • Rasch, G.. (1960). Probabilistic Models for Some Intelligence and Attainment Tests.
  • Hambleton, R. K., Swaminathan, H. & Rogers, H. J.. (1991). Fundamentals of Item Response Theory.
  • Embretson, S. E. & Reise, S. P.. (2000). Item Response Theory for Psychologists. 10.4324/9781410605269

Lý Thuyết Liên Quan

Classical Test TheoryRasch Measurement TheoryGeneralizability TheoryLatent Trait TheoryFactor Analysis
Lý thuyết Đáp ứng Câu hỏi (IRT), định nghĩa, bằng chứng và cách đo lường | NOESIS