noesisnoesis
測量如何運作

測量標準誤:您的得分可能存在的誤差範圍

每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。

測量標準誤將抽象的信度係數轉化為具體的東西:一個圍繞得分的正負區間。它回答了大多數結果畫面留而未答的問題:如果我在不同的下午接受這個測驗,這個數字可能會有多大的差異?

公式很簡單。將量表的標準差乘以一減去其信度後取平方根。對於標準差為10、信度為0.85的量表,標準誤約為3.9分。

這個區間實際涵蓋的內容

大約三分之二的時間,一個人的真實水準會落在其觀察得分的一個標準誤範圍內。若要達到約95%的信心水準,則需要大約兩個標準誤的範圍。

以上面的例子來說,某人得分62。95%的信賴區間大約從54到70。這是一個十六分的範圍,而在該量表中,平均水準與明顯高於平均水準之間的典型差距可能只有十分。

這並非該特定測驗的缺陷。0.85的信度已經相當不錯。這是心理測量的正常精確度,也是嚴謹的報告呈現區間而非單一數值的原因。

人們容易忽略的後果

量表之間的小差異通常沒有意義。 如果您的外向性得分是58,開放性得分是54,誠實的解讀是這兩者無法區分。從四分的差距中構建敘事的側寫解讀,其實只是在解讀噪音。

隨時間發生的小變化通常也沒有意義。 對大多數測驗工具而言,重新接受測驗後移動五分仍在誤差範圍之內。真正的特質變化是經年累月發生的,會表現為明顯超出誤差範圍的變動,而不是每個月幾分的差異。

排序會放大這個問題。 在分布密集的中段(大多數人所在的位置),僅僅幾個原始分數的差異就可能讓一個人的百分位數移動十個名次。百分位數排名看起來很精確,卻是表達得分時最不穩定的方式。

整個量表的精確度並非一致的。 古典測驗理論假設每個得分都有相同的誤差值,這是一種簡化。試題反應理論會在特質的每個水準分別建模誤差,而在極端值時誤差幾乎總是更大,恰恰是在最重要的解讀發生的地方。極高或極低的得分通常比中等得分的精確度更低,而非更高。

為何誠實的報告方式看起來不那麼令人印象深刻

一個報告信賴區間的測驗工具,看起來比報告到小數點後一位單一數字的工具更模糊。而那個看起來模糊的工具其實在說真話。那個看起來精確的工具,其實有著相同的潛在誤差,只是選擇不呈現出來而已。

在比較一個有科學文獻支持的測驗與一個將您分類的商業產品時,這一點值得牢記。類別的界線落在一個特定的得分上,而低於這個界線一分的人和高於這個界線一分的人,在統計上其實是同一個人。類型標籤完全掩蓋了這一點,這是反對以類型為基礎之測驗工具的較嚴重論點之一,也是為何附有明確誤差說明的連續得分是研究中的標準做法。

付諸實測

閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。

繼續閱讀

測量標準誤:您的得分可能存在的誤差範圍 | NOESIS