測量標準誤:您的得分可能存在的誤差範圍
每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
測量標準誤將抽象的信度係數轉化為具體的東西:一個圍繞得分的正負區間。它回答了大多數結果畫面留而未答的問題:如果我在不同的下午接受這個測驗,這個數字可能會有多大的差異?
公式很簡單。將量表的標準差乘以一減去其信度後取平方根。對於標準差為10、信度為0.85的量表,標準誤約為3.9分。
這個區間實際涵蓋的內容
大約三分之二的時間,一個人的真實水準會落在其觀察得分的一個標準誤範圍內。若要達到約95%的信心水準,則需要大約兩個標準誤的範圍。
以上面的例子來說,某人得分62。95%的信賴區間大約從54到70。這是一個十六分的範圍,而在該量表中,平均水準與明顯高於平均水準之間的典型差距可能只有十分。
這並非該特定測驗的缺陷。0.85的信度已經相當不錯。這是心理測量的正常精確度,也是嚴謹的報告呈現區間而非單一數值的原因。
人們容易忽略的後果
量表之間的小差異通常沒有意義。 如果您的外向性得分是58,開放性得分是54,誠實的解讀是這兩者無法區分。從四分的差距中構建敘事的側寫解讀,其實只是在解讀噪音。
隨時間發生的小變化通常也沒有意義。 對大多數測驗工具而言,重新接受測驗後移動五分仍在誤差範圍之內。真正的特質變化是經年累月發生的,會表現為明顯超出誤差範圍的變動,而不是每個月幾分的差異。
排序會放大這個問題。 在分布密集的中段(大多數人所在的位置),僅僅幾個原始分數的差異就可能讓一個人的百分位數移動十個名次。百分位數排名看起來很精確,卻是表達得分時最不穩定的方式。
整個量表的精確度並非一致的。 古典測驗理論假設每個得分都有相同的誤差值,這是一種簡化。試題反應理論會在特質的每個水準分別建模誤差,而在極端值時誤差幾乎總是更大,恰恰是在最重要的解讀發生的地方。極高或極低的得分通常比中等得分的精確度更低,而非更高。
為何誠實的報告方式看起來不那麼令人印象深刻
一個報告信賴區間的測驗工具,看起來比報告到小數點後一位單一數字的工具更模糊。而那個看起來模糊的工具其實在說真話。那個看起來精確的工具,其實有著相同的潛在誤差,只是選擇不呈現出來而已。
在比較一個有科學文獻支持的測驗與一個將您分類的商業產品時,這一點值得牢記。類別的界線落在一個特定的得分上,而低於這個界線一分的人和高於這個界線一分的人,在統計上其實是同一個人。類型標籤完全掩蓋了這一點,這是反對以類型為基礎之測驗工具的較嚴重論點之一,也是為何附有明確誤差說明的連續得分是研究中的標準做法。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。