Sai số chuẩn của đo lường: điểm số của bạn có thể lệch bao nhiêu
Mỗi điểm số đều mang một biên độ sai số, và với hầu hết các bài trắc nghiệm tâm lý, biên độ này rộng hơn nhiều so với những gì người ta thường nghĩ. Đây là con số cho bạn biết khi nào một sự khác biệt là thực sự và khi nào chỉ là nhiễu.
Sai số chuẩn của đo lường chuyển đổi một hệ số độ tin cậy trừu tượng thành một điều gì đó cụ thể hơn: một khoảng cộng trừ xung quanh một điểm số. Nó trả lời cho câu hỏi mà hầu hết các màn hình kết quả không trả lời: điểm số này có thể khác đi bao nhiều nếu tôi làm bài trắc nghiệm vào một buổi chiều khác?
Công thức rất đơn giản. Nhân độ lệch chuẩn của thang đo với căn bậc hai của một trừ độ tin cậy của nó. Với một thang đo có độ lệch chuẩn là 10 và độ tin cậy là 0,85, sai số chuẩn là khoảng 3,9 điểm.
Khoảng đó thực sự bao gồm những gì
Khoảng hai phần ba thời gian, vị trí thực sự của một người nằm trong khoảng một sai số chuẩn so với điểm số quan sát được của họ. Để có khoảng 95 phần trăm độ tin cậy, bạn cần khoảng hai sai số chuẩn ở mỗi phía.
Hãy lấy ví dụ trên. Một người đạt điểm 62. Khoảng tin cậy 95 phần trăm chạy từ khoảng 54 đến 70. Đó là một khoảng mười sáu điểm trên một thang đo mà khoảng cách điển hình giữa mức trung bình và mức rõ ràng trên trung bình có thể chỉ là mười điểm.
Đây không phải là một khiếm khuyết của bài trắc nghiệm cụ thể đó. Độ tin cậy 0,85 là đáng nể. Đây là độ chính xác thông thường của phép đo lường tâm lý, và đó là lý do các báo cáo cẩn thận trình bày khoảng thay vì các điểm cụ thể.
Những hệ quả mà người ta thường bỏ lỡ
Sự khác biệt nhỏ giữa các thang đo thường không có ý nghĩa gì. Nếu điểm hướng ngoại của bạn là 58 và điểm cởi mở của bạn là 54, cách đọc trung thực là chúng không thể phân biệt được. Các diễn giải hồ sơ xây dựng một câu chuyện từ những khoảng cách bốn điểm đang đọc nhiễu.
Những thay đổi nhỏ theo thời gian cũng thường không có ý nghĩa gì. Làm lại một bài trắc nghiệm và thay đổi năm điểm là nằm trong phạm vi sai số đối với hầu hết các công cụ. Sự thay đổi đặc điểm thực sự diễn ra trong nhiều năm và biểu hiện là một sự chuyển động vượt xa ra ngoài khoảng sai số, không phải là vài điểm mỗi tháng.
Thứ hạng khuếch đại vấn đề. Một sự khác biệt vài điểm thô có thể làm dịch chuyển một người mười vị trí bách phân vị ở phần giữa dày đặc của một phân phối, bởi vì đó là nơi hầu hết mọi người nằm ở đó. Bách phân vị trông có vẻ chính xác và là cách kém ổn định nhất để diễn đạt một điểm số.
Độ chính xác không đồng nhất trên toàn thang đo. Lý thuyết trắc nghiệm cổ điển giả định một giá trị sai số duy nhất cho mọi điểm số, đây là một sự đơn giản hóa. Lý thuyết ứng đáp câu hỏi mô hình hóa sai số riêng biệt ở từng mức độ của đặc điểm, và nó gần như luôn lớn hơn ở các cực, chính xác là nơi những diễn giải có hệ quả nghiêm trọng nhất được đưa ra. Một điểm số rất cao hoặc rất thấp thường kém chính xác hơn một điểm số trung bình, không phải chính xác hơn.
Tại sao báo cáo trung thực trông kém ấn tượng hơn
Một công cụ báo cáo khoảng tin cậy trông mơ hồ hơn so với một công cụ báo cáo một số duy nhất với một chữ số thập phân. Công cụ mơ hồ hơn đang nói sự thật. Công cụ trông có vẻ chính xác có cùng sai số nền tảng và đã chọn không hiển thị nó.
Điều này đáng để ghi nhớ khi so sánh một bài trắc nghiệm được ghi chép khoa học với một sản phẩm thương mại phân loại bạn vào một danh mục. Ranh giới danh mục nằm ở một điểm số cụ thể, và một người thấp hơn một điểm và một người cao hơn một điểm, về mặt thống kê, là cùng một người. Nhãn kiểu loại che khuất hoàn toàn điều đó, đây là một trong những lập luận nghiêm trọng hơn chống lại các công cụ dựa trên kiểu loại, và là lý do các điểm số liên tục kèm sai số đã công bố là chuẩn mực trong nghiên cứu.
Thử nghiệm thực tế
Đọc về đo lường là một chuyện. Nhìn thấy điểm số của chính bạn được báo cáo cùng với nguồn gốc, mẫu chuẩn và giới hạn của nó lại là chuyện khác. Miễn phí khi làm, không cần đăng ký.
Tiếp tục đọc
- Trắc nghiệm tâm lý là gì?Ngành học nghiên cứu xem một phép đo tâm lý có tốt hay không, và cũng là lý do vì sao hai bài trắc nghiệm hỏi những câu tương tự nhau lại có thể khác nhau rất lớn về giá trị của kết quả mà chúng đem lại.
- Độ tin cậy trong bài trắc nghiệm tâm lý là gì?Độ tin cậy là tính nhất quán của phép đo, không phải là tính đúng đắn. Một bài trắc nghiệm có thể có độ tin cậy rất cao nhưng vẫn đo sai thứ cần đo, đó là lý do vì sao đây là câu hỏi được đặt ra đầu tiên và không bao giờ là câu hỏi cuối cùng.
- Độ hiệu lực trong trắc nghiệm tâm lý là gì?Độ hiệu lực không phải là một thuộc tính mà một bài trắc nghiệm sở hữu. Đó là một luận điểm về việc liệu một cách diễn giải cụ thể của một điểm số cụ thể, cho một mục đích cụ thể, có đứng vững hay không, và luận điểm đó phải được xây dựng lại cho mỗi lần sử dụng mới.
- Độ hiệu lực cấu trúc là gì?Câu hỏi khó nhất trong đo lường: liệu thứ mà bạn đang đo có tồn tại như bạn đã định nghĩa nó hay không, và liệu công cụ của bạn có tiếp cận được đúng thứ đó chứ không phải một thứ khác gần giống nó.
- Độ hiệu lực hội tụ và độ hiệu lực phân biệtHai yêu cầu đối xứng với nhau: một phép đo phải tương đồng với những gì nó cần tương đồng, và phải tách biệt rõ với những gì nó tuyên bố không phải là. Hầu hết các công cụ yếu kém đều thất bại ở yêu cầu thứ hai.
- Alpha của Cronbach là gì, và không phải là gìChỉ số được báo cáo nhiều nhất trong trắc nghiệm tâm lý, và cũng là chỉ số bị hiểu sai nhiều nhất. Alpha không cho bạn biết một thang đo là đơn chiều, và một giá trị cao thường là dấu hiệu của vấn đề hơn là một ưu điểm.
- Chuẩn và bách phân vị: điểm số của bạn được so sánh với gìMột điểm thô không thể tự diễn giải được. Nó chỉ có ý nghĩa khi được đối chiếu với một nhóm tham chiếu, và nhóm nào đã được sử dụng là một trong những sự thật có tác động lớn nhất và ít được công khai nhất về bất kỳ bài trắc nghiệm nào.
- Cách một bài trắc nghiệm tâm lý thực sự được xây dựngTừ định nghĩa cấu trúc đến các chuẩn được công bố, quá trình này kéo dài nhiều năm và loại bỏ hầu hết những gì đưa vào nó. Biết được các bước này giúp bạn dễ dàng nhận ra bước nào đã bị một bài trắc nghiệm nhanh trên mạng bỏ qua.
- Bài trắc nghiệm được gọi là đã được xác nhận độ hiệu lực có nghĩa là gì?Từ này không được quản lý và được sử dụng tự do bởi các sản phẩm chưa từng làm bất kỳ công việc nào cần thiết. Đây là ý nghĩa của nó khi nó thực sự có ý nghĩa, và bốn câu hỏi giúp phân biệt hai trường hợp đó.
- Vì sao hầu hết các bài trắc nghiệm tính cách trên internet không đáng tin cậyKhông phải vì họ không trung thực, mà vì các bước làm cho một phép đo trở nên đáng tin cậy là vô hình, tốn kém và dễ bị bỏ qua, và việc bỏ qua chúng không làm thay đổi gì về vẻ ngoài của kết quả.
- Tự báo cáo có thể đo lường điều gì và không thể đo lường điều gìCác bảng câu hỏi yêu cầu bạn trở thành người quan sát chính mình, và cách này hiệu quả hơn với một số điều so với những điều khác. Biết được phương pháp này mạnh ở đâu và yếu ở đâu sẽ thay đổi cách bạn đọc bất kỳ kết quả nào.
- Việc một bài trắc nghiệm dự đoán được điều gì đó nghĩa là gìMột hệ số tương quan 0,30 là một phát hiện mạnh trong nghiên cứu nhân cách nhưng lại là một cơ sở yếu để ra quyết định về một cá nhân cụ thể. Cả hai nhận định đều đúng, và khoảng cách giữa chúng chính là nguyên nhân của hầu hết các trường hợp sử dụng sai kết quả bài trắc nghiệm.
- Sàng lọc không phải là chẩn đoánMột bảng câu hỏi sàng lọc được thiết kế để phát hiện càng nhiều trường hợp có thể càng tốt, chấp nhận một tỷ lệ dương tính giả cao như một cái giá phải trả. Đọc một điểm số sàng lọc như một chẩn đoán là đảo ngược mục đích ban đầu mà nó được thiết kế để phục vụ.