Độ hiệu lực trong trắc nghiệm tâm lý là gì?
Độ hiệu lực không phải là một thuộc tính mà một bài trắc nghiệm sở hữu. Đó là một luận điểm về việc liệu một cách diễn giải cụ thể của một điểm số cụ thể, cho một mục đích cụ thể, có đứng vững hay không, và luận điểm đó phải được xây dựng lại cho mỗi lần sử dụng mới.
Độ hiệu lực đặt ra câu hỏi liệu một bài trắc nghiệm có đo lường đúng những gì nó tuyên bố đo lường hay không, và liệu những kết luận mà người ta rút ra từ điểm số của nó có chính đáng hay không. Đây là câu hỏi trung tâm trong khoa học đo lường tâm lý, và cũng là câu hỏi thường được trả lời bằng một tuyên bố tiếp thị hơn là bằng bằng chứng.
Cách hiểu hiện đại, vốn được duy trì từ công trình của Messick vào những năm 1980, cho rằng độ hiệu lực không phải là một thuộc tính cố định của một công cụ đo. Đó là một thuộc tính của cách diễn giải điểm số cho một mục đích sử dụng cụ thể. Cùng một bảng câu hỏi có thể có độ hiệu lực tốt khi dùng để mô tả nhận thức của một người về bản thân, nhưng lại hoàn toàn không có độ hiệu lực khi dùng để quyết định có tuyển dụng người đó hay không. Nói rằng "bài trắc nghiệm này có độ hiệu lực" mà không nói rõ có độ hiệu lực cho mục đích gì thì không phải là một tuyên bố có căn cứ; đó chỉ là một khẩu hiệu.
Các loại bằng chứng
Độ hiệu lực được xây dựng từ việc tích lũy nhiều loại bằng chứng khác nhau. Các tài liệu cũ trình bày chúng như những loại độ hiệu lực riêng biệt; quan điểm hiện nay coi chúng là những luận điểm khác nhau cùng ủng hộ cho một luận cứ duy nhất.
Bằng chứng về nội dung đặt ra câu hỏi liệu các câu hỏi có bao quát đầy đủ khái niệm được đo hay không. Một thang đo trầm cảm chỉ hỏi về giấc ngủ và cảm giác thèm ăn sẽ bao quát được các triệu chứng cơ thể nhưng bỏ sót các triệu chứng về cảm xúc và nhận thức. Mức độ bao quát nội dung thường được đánh giá bởi các chuyên gia trong lĩnh vực, và đây cũng là lý do vì sao các thang đo quá ngắn luôn là một sự thỏa hiệp.
Bằng chứng về cấu trúc nội tại đặt ra câu hỏi liệu các câu hỏi có tập hợp thành nhóm đúng theo cách mà lý thuyết đã dự đoán hay không. Nếu một mô hình cho rằng có bốn khía cạnh riêng biệt, thì phân tích nhân tố cần phải cho ra bốn nhân tố, và điều quan trọng là điều này phải đúng trên một mẫu độc lập, chứ không chỉ trên mẫu mà thang đo đã được xây dựng từ đó. Rất nhiều công cụ đo tái hiện được đúng cấu trúc dự kiến trên mẫu phát triển ban đầu nhưng lại thất bại trên bất kỳ mẫu nào khác.
Mối quan hệ với các biến số khác là nơi phần lớn công việc kiểm chứng diễn ra. Bằng chứng hội tụ cho thấy thang đo có tương quan với những thứ mà nó lẽ ra phải tương quan. Bằng chứng phân biệt cho thấy thang đo không tương quan quá cao với những thứ mà nó lẽ ra phải khác biệt, đây là một yêu cầu thường xuyên bị bỏ qua, và cũng là yếu tố khiến rất nhiều khái niệm được gắn nhãn mới thất bại. Bằng chứng về tiêu chí cho thấy điểm số có liên quan đến một kết quả có ý nghĩa thực tế, dù được đo cùng thời điểm hay được dự đoán trước.
Bằng chứng về hệ quả đặt ra câu hỏi điều gì sẽ xảy ra khi bài trắc nghiệm được sử dụng trong thực tế. Nếu một công cụ đo một cách có hệ thống gây bất lợi cho một nhóm người vì những lý do không liên quan đến khái niệm được đo, đó là một vấn đề về độ hiệu lực, chứ không chỉ đơn thuần là một vấn đề đạo đức.
Câu hỏi phơi bày phần lớn các tuyên bố
Phép thử sắc bén nhất đối với một tuyên bố về độ hiệu lực chính là độ hiệu lực gia tăng: liệu công cụ đo này có cung cấp thêm điều gì so với những gì một công cụ rẻ hơn, cũ hơn, đã được thiết lập từ trước đã cho biết hay không?
Một số lượng đáng kể các khái niệm được gắn nhãn mới đã thất bại ở phép thử này. Chúng tương quan 0.7 trở lên với một chiều kích Big Five đã có sẵn, dự đoán cùng những kết quả với cùng mức độ, và không thêm được gì một khi công cụ cũ hơn được kiểm soát về mặt thống kê. Khái niệm thì mới, nhưng phép đo thì không. Đây là lý do vì sao phần phê bình trong các tài liệu nghiêm túc về công cụ đo thường tập trung vào tính dư thừa hơn là tính thiếu chính xác.
Những điều cần chú ý
Khi ai đó tuyên bố rằng một bài trắc nghiệm đã được kiểm chứng độ hiệu lực, những câu hỏi hữu ích cần đặt ra là những câu hỏi cụ thể. Được kiểm chứng dựa trên tiêu chí nào? Trên quần thể nào, với cỡ mẫu bao nhiêu? Cấu trúc nhân tố đã được xác nhận trên một mẫu độc lập hay chưa? Có bằng chứng đã được công bố từ các nhà nghiên cứu không có lợi ích thương mại trong kết quả đó hay không? Nó có thêm được điều gì so với một lựa chọn thay thế đã được thiết lập hay không?
Một công cụ đo có những câu trả lời trung thực cho những câu hỏi đó đáng được xem xét nghiêm túc, kể cả những hạn chế của nó. Một công cụ đo mà bằng chứng về độ hiệu lực chỉ gồm một trang lời chứng thực và một tuyên bố rằng hàng triệu người đã làm bài trắc nghiệm đó thì thực ra đang trả lời một câu hỏi hoàn toàn khác: mức độ phổ biến không phải là bằng chứng, và số lượng người đã làm một bài trắc nghiệm không nói lên được điều gì về việc liệu điểm số của nó có ý nghĩa hay không.
Thử nghiệm thực tế
Đọc về đo lường là một chuyện. Nhìn thấy điểm số của chính bạn được báo cáo cùng với nguồn gốc, mẫu chuẩn và giới hạn của nó lại là chuyện khác. Miễn phí khi làm, không cần đăng ký.
Tiếp tục đọc
- Trắc nghiệm tâm lý là gì?Ngành học nghiên cứu xem một phép đo tâm lý có tốt hay không, và cũng là lý do vì sao hai bài trắc nghiệm hỏi những câu tương tự nhau lại có thể khác nhau rất lớn về giá trị của kết quả mà chúng đem lại.
- Độ tin cậy trong bài trắc nghiệm tâm lý là gì?Độ tin cậy là tính nhất quán của phép đo, không phải là tính đúng đắn. Một bài trắc nghiệm có thể có độ tin cậy rất cao nhưng vẫn đo sai thứ cần đo, đó là lý do vì sao đây là câu hỏi được đặt ra đầu tiên và không bao giờ là câu hỏi cuối cùng.
- Độ hiệu lực cấu trúc là gì?Câu hỏi khó nhất trong đo lường: liệu thứ mà bạn đang đo có tồn tại như bạn đã định nghĩa nó hay không, và liệu công cụ của bạn có tiếp cận được đúng thứ đó chứ không phải một thứ khác gần giống nó.
- Độ hiệu lực hội tụ và độ hiệu lực phân biệtHai yêu cầu đối xứng với nhau: một phép đo phải tương đồng với những gì nó cần tương đồng, và phải tách biệt rõ với những gì nó tuyên bố không phải là. Hầu hết các công cụ yếu kém đều thất bại ở yêu cầu thứ hai.
- Alpha của Cronbach là gì, và không phải là gìChỉ số được báo cáo nhiều nhất trong trắc nghiệm tâm lý, và cũng là chỉ số bị hiểu sai nhiều nhất. Alpha không cho bạn biết một thang đo là đơn chiều, và một giá trị cao thường là dấu hiệu của vấn đề hơn là một ưu điểm.
- Sai số chuẩn của đo lường: điểm số của bạn có thể lệch bao nhiêuMỗi điểm số đều mang một biên độ sai số, và với hầu hết các bài trắc nghiệm tâm lý, biên độ này rộng hơn nhiều so với những gì người ta thường nghĩ. Đây là con số cho bạn biết khi nào một sự khác biệt là thực sự và khi nào chỉ là nhiễu.
- Chuẩn và bách phân vị: điểm số của bạn được so sánh với gìMột điểm thô không thể tự diễn giải được. Nó chỉ có ý nghĩa khi được đối chiếu với một nhóm tham chiếu, và nhóm nào đã được sử dụng là một trong những sự thật có tác động lớn nhất và ít được công khai nhất về bất kỳ bài trắc nghiệm nào.
- Cách một bài trắc nghiệm tâm lý thực sự được xây dựngTừ định nghĩa cấu trúc đến các chuẩn được công bố, quá trình này kéo dài nhiều năm và loại bỏ hầu hết những gì đưa vào nó. Biết được các bước này giúp bạn dễ dàng nhận ra bước nào đã bị một bài trắc nghiệm nhanh trên mạng bỏ qua.
- Bài trắc nghiệm được gọi là đã được xác nhận độ hiệu lực có nghĩa là gì?Từ này không được quản lý và được sử dụng tự do bởi các sản phẩm chưa từng làm bất kỳ công việc nào cần thiết. Đây là ý nghĩa của nó khi nó thực sự có ý nghĩa, và bốn câu hỏi giúp phân biệt hai trường hợp đó.
- Vì sao hầu hết các bài trắc nghiệm tính cách trên internet không đáng tin cậyKhông phải vì họ không trung thực, mà vì các bước làm cho một phép đo trở nên đáng tin cậy là vô hình, tốn kém và dễ bị bỏ qua, và việc bỏ qua chúng không làm thay đổi gì về vẻ ngoài của kết quả.
- Tự báo cáo có thể đo lường điều gì và không thể đo lường điều gìCác bảng câu hỏi yêu cầu bạn trở thành người quan sát chính mình, và cách này hiệu quả hơn với một số điều so với những điều khác. Biết được phương pháp này mạnh ở đâu và yếu ở đâu sẽ thay đổi cách bạn đọc bất kỳ kết quả nào.
- Việc một bài trắc nghiệm dự đoán được điều gì đó nghĩa là gìMột hệ số tương quan 0,30 là một phát hiện mạnh trong nghiên cứu nhân cách nhưng lại là một cơ sở yếu để ra quyết định về một cá nhân cụ thể. Cả hai nhận định đều đúng, và khoảng cách giữa chúng chính là nguyên nhân của hầu hết các trường hợp sử dụng sai kết quả bài trắc nghiệm.
- Sàng lọc không phải là chẩn đoánMột bảng câu hỏi sàng lọc được thiết kế để phát hiện càng nhiều trường hợp có thể càng tốt, chấp nhận một tỷ lệ dương tính giả cao như một cái giá phải trả. Đọc một điểm số sàng lọc như một chẩn đoán là đảo ngược mục đích ban đầu mà nó được thiết kế để phục vụ.