Vì sao hầu hết các bài trắc nghiệm tính cách trên internet không đáng tin cậy
Không phải vì họ không trung thực, mà vì các bước làm cho một phép đo trở nên đáng tin cậy là vô hình, tốn kém và dễ bị bỏ qua, và việc bỏ qua chúng không làm thay đổi gì về vẻ ngoài của kết quả.
Một bài trắc nghiệm tính cách miễn phí trên mạng và một công cụ đo lường tâm lý đã được kiểm chứng tạo ra kết quả trông giống hệt nhau: một điểm số, một bách phân vị, một đoạn văn mô tả về bạn. Sự khác biệt hoàn toàn nằm ở phần công việc mà bạn không thể nhìn thấy từ màn hình kết quả.
Điều này đáng để nói cho chính xác, bởi vì cách nhìn nhận thông thường, rằng các bài trắc nghiệm trên mạng là lừa đảo, phần lớn là sai và không mấy hữu ích. Đa số được tạo ra bởi những người không có ý định lừa dối. Chúng không đáng tin cậy vì những lý do mang tính cấu trúc.
Những điều thường bị bỏ qua
Phân tích câu hỏi. Trong một thang đo được xây dựng đúng cách, phần lớn các câu hỏi được soạn thảo ban đầu sẽ bị loại bỏ sau giai đoạn thử nghiệm: những câu hỏi mà không ai trả lời khác nhau, những câu hỏi tương quan kém với tổng điểm, những câu hỏi tải lên nhiều hơn một yếu tố, những câu hỏi có biểu hiện khác nhau giữa các nhóm tuổi hoặc ngôn ngữ. Một bài trắc nghiệm được viết và xuất bản mà không qua thử nghiệm sẽ giữ lại tất cả mọi thứ, kể cả những câu hỏi không hoạt động tốt.
Xác nhận cấu trúc độc lập. Phân tích yếu tố trên chính dữ liệu mà bạn đã dùng để xây dựng thang đo sẽ tái tạo lại cấu trúc mà bạn đã thiết kế. Việc xác nhận điều đó trên một mẫu dữ liệu mới là một nghiên cứu riêng biệt, và đây chính là bước mà phần lớn các thang đo thất bại.
Chuẩn. Bách phân vị phải đến từ một nguồn nào đó. Nếu trang web không nêu rõ nhóm dân số tham chiếu của mình, con số đó được tính ra hoặc là từ những người truy cập trước đó, một nhóm tự chọn với thành phần không xác định, hoặc là không dựa trên điều gì cụ thể cả.
Dữ liệu kiểm tra lặp lại. Để xác định rằng mọi người đạt điểm số tương tự vào tháng sau, cần phải tìm lại chính những người đó. Hầu như không ai làm điều này, nghĩa là tính ổn định mà từ "đặc điểm" hàm ý vẫn chưa được chứng minh.
Động lực thiết kế đi sai hướng
Một bài trắc nghiệm được xây dựng để thu hút tương tác được tối ưu hóa cho một kết quả khác so với một bài trắc nghiệm được xây dựng để đạt độ chính xác, và hai mục tiêu này tách rời nhau theo những cách có thể đoán trước.
Những kết quả mang tính tâng bốc hoạt động hiệu quả hơn. Một kết quả cho bạn biết điều gì đó không mấy dễ chịu sẽ ít được chia sẻ hơn, vì vậy các kết quả dần trôi về hướng những mô tả mà ai cũng nhận ra ở chính mình. Đây chính là hiệu ứng Barnum, đã được chứng minh vào những năm 1940 và được tái hiện một cách đáng tin cậy kể từ đó: người ta đánh giá những mô tả tính cách chung chung là chính xác cao độ đối với riêng bản thân mình.
Các kiểu loại hoạt động hiệu quả hơn các chiều kích. "Bạn là một Kiến trúc sư" dễ được chia sẻ hơn "bạn ở bách phân vị thứ 68 về tính cởi mở với một khoảng tin cậy rộng". Các kiểu loại cũng che giấu sai số đo lường, vì một người lệch một điểm về phía bên này hay bên kia của ranh giới phân loại sẽ nhận được những nhãn hoàn toàn khác nhau.
Ngắn gọn hoạt động hiệu quả hơn đầy đủ. Mỗi câu hỏi bổ sung đều làm mất đi một số người trả lời, vì vậy các bài trắc nghiệm bị cắt ngắn đến độ dài tối đa hóa tỷ lệ hoàn thành thay vì độ dài bao quát đầy đủ khái niệm cần đo.
Không điều nào trong số này là lời nói dối. Chúng là sự tối ưu hóa cho một chỉ số khác ngoài độ chính xác.
Cách nhận biết trong khoảng ba mươi giây
Hãy tìm xem có công cụ đo lường gốc được nêu tên cụ thể cùng với tác giả và năm xuất bản hay không. Hãy tìm xem có nêu rõ chuẩn được lấy từ nhóm dân số nào hay không. Hãy tìm xem có bất kỳ sự thừa nhận nào về những hạn chế hoặc sai số đo lường hay không. Hãy xem kết quả là một điểm số liên tục hay là một kiểu loại. Hãy xem cùng một trang đó có hứa hẹn xác định nghề nghiệp lý tưởng, bạn đời hoặc mục đích sống của bạn chỉ từ hai mươi câu hỏi hay không.
Một bài trắc nghiệm nêu tên công cụ đo lường của mình, trích dẫn nguồn gốc của nó, nêu rõ các chuẩn của nó, và nói rõ những gì nó không thể cho bạn biết là bài đã thực hiện đầy đủ công việc cần thiết. Một bài không làm bất kỳ điều nào trong số đó vẫn có thể là một cách dễ chịu để dành năm phút, nhưng con số mà nó tạo ra chỉ là trang trí.
Mọi công cụ đo lường trong danh mục của NOESIS đều nêu rõ nó triển khai bài trắc nghiệm đã được công bố nào, ai là người viết ra nó, vào năm nào, cách nó được chấm điểm ra sao, và những gì kết quả của nó không thể chứng minh được. Phần cuối cùng đó chính là điều đáng để đem ra so sánh.
Thử nghiệm thực tế
Đọc về đo lường là một chuyện. Nhìn thấy điểm số của chính bạn được báo cáo cùng với nguồn gốc, mẫu chuẩn và giới hạn của nó lại là chuyện khác. Miễn phí khi làm, không cần đăng ký.
Tiếp tục đọc
- Trắc nghiệm tâm lý là gì?Ngành học nghiên cứu xem một phép đo tâm lý có tốt hay không, và cũng là lý do vì sao hai bài trắc nghiệm hỏi những câu tương tự nhau lại có thể khác nhau rất lớn về giá trị của kết quả mà chúng đem lại.
- Độ tin cậy trong bài trắc nghiệm tâm lý là gì?Độ tin cậy là tính nhất quán của phép đo, không phải là tính đúng đắn. Một bài trắc nghiệm có thể có độ tin cậy rất cao nhưng vẫn đo sai thứ cần đo, đó là lý do vì sao đây là câu hỏi được đặt ra đầu tiên và không bao giờ là câu hỏi cuối cùng.
- Độ hiệu lực trong trắc nghiệm tâm lý là gì?Độ hiệu lực không phải là một thuộc tính mà một bài trắc nghiệm sở hữu. Đó là một luận điểm về việc liệu một cách diễn giải cụ thể của một điểm số cụ thể, cho một mục đích cụ thể, có đứng vững hay không, và luận điểm đó phải được xây dựng lại cho mỗi lần sử dụng mới.
- Độ hiệu lực cấu trúc là gì?Câu hỏi khó nhất trong đo lường: liệu thứ mà bạn đang đo có tồn tại như bạn đã định nghĩa nó hay không, và liệu công cụ của bạn có tiếp cận được đúng thứ đó chứ không phải một thứ khác gần giống nó.
- Độ hiệu lực hội tụ và độ hiệu lực phân biệtHai yêu cầu đối xứng với nhau: một phép đo phải tương đồng với những gì nó cần tương đồng, và phải tách biệt rõ với những gì nó tuyên bố không phải là. Hầu hết các công cụ yếu kém đều thất bại ở yêu cầu thứ hai.
- Alpha của Cronbach là gì, và không phải là gìChỉ số được báo cáo nhiều nhất trong trắc nghiệm tâm lý, và cũng là chỉ số bị hiểu sai nhiều nhất. Alpha không cho bạn biết một thang đo là đơn chiều, và một giá trị cao thường là dấu hiệu của vấn đề hơn là một ưu điểm.
- Sai số chuẩn của đo lường: điểm số của bạn có thể lệch bao nhiêuMỗi điểm số đều mang một biên độ sai số, và với hầu hết các bài trắc nghiệm tâm lý, biên độ này rộng hơn nhiều so với những gì người ta thường nghĩ. Đây là con số cho bạn biết khi nào một sự khác biệt là thực sự và khi nào chỉ là nhiễu.
- Chuẩn và bách phân vị: điểm số của bạn được so sánh với gìMột điểm thô không thể tự diễn giải được. Nó chỉ có ý nghĩa khi được đối chiếu với một nhóm tham chiếu, và nhóm nào đã được sử dụng là một trong những sự thật có tác động lớn nhất và ít được công khai nhất về bất kỳ bài trắc nghiệm nào.
- Cách một bài trắc nghiệm tâm lý thực sự được xây dựngTừ định nghĩa cấu trúc đến các chuẩn được công bố, quá trình này kéo dài nhiều năm và loại bỏ hầu hết những gì đưa vào nó. Biết được các bước này giúp bạn dễ dàng nhận ra bước nào đã bị một bài trắc nghiệm nhanh trên mạng bỏ qua.
- Bài trắc nghiệm được gọi là đã được xác nhận độ hiệu lực có nghĩa là gì?Từ này không được quản lý và được sử dụng tự do bởi các sản phẩm chưa từng làm bất kỳ công việc nào cần thiết. Đây là ý nghĩa của nó khi nó thực sự có ý nghĩa, và bốn câu hỏi giúp phân biệt hai trường hợp đó.
- Tự báo cáo có thể đo lường điều gì và không thể đo lường điều gìCác bảng câu hỏi yêu cầu bạn trở thành người quan sát chính mình, và cách này hiệu quả hơn với một số điều so với những điều khác. Biết được phương pháp này mạnh ở đâu và yếu ở đâu sẽ thay đổi cách bạn đọc bất kỳ kết quả nào.
- Việc một bài trắc nghiệm dự đoán được điều gì đó nghĩa là gìMột hệ số tương quan 0,30 là một phát hiện mạnh trong nghiên cứu nhân cách nhưng lại là một cơ sở yếu để ra quyết định về một cá nhân cụ thể. Cả hai nhận định đều đúng, và khoảng cách giữa chúng chính là nguyên nhân của hầu hết các trường hợp sử dụng sai kết quả bài trắc nghiệm.
- Sàng lọc không phải là chẩn đoánMột bảng câu hỏi sàng lọc được thiết kế để phát hiện càng nhiều trường hợp có thể càng tốt, chấp nhận một tỷ lệ dương tính giả cao như một cái giá phải trả. Đọc một điểm số sàng lọc như một chẩn đoán là đảo ngược mục đích ban đầu mà nó được thiết kế để phục vụ.