心理測驗中的信度是什麼?
信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
信度是指一項測量方法能夠重複再現、而非僅是噪音的程度。如果你在一分鐘內量了三次體重,分別得到71、78和66公斤,這個體重計就是不可靠的,而你也無法從中得知自己實際的體重。心理測量面對的是同樣的問題,但所用的工具卻精確得多。
關於信度,最關鍵要理解的是它「並不」宣稱什麼。一個一致地多顯示八公斤的體重計是完全可靠的,卻也是完全錯誤的。信度關乎一致性;至於這個數字是否代表了正確的意義,則是另一個問題,稱為效度。信度是效度的必要條件,但遠遠不足以構成效度。
信度的形式
內部一致性探問量表上的題目是否彼此相符。如果十道題目都是用來測量同一個潛在特質,那麼在某一題得分高的人,通常在其他題目上也會得分高。這通常以Cronbach's alpha,或更好的McDonald's omega來呈現。
重測信度探問同一個人在兩個不同時間點的得分是否相似。這是對特質而言最重要的信度形式,因為特質依定義應該是穩定的。它也是最常被省略不報告的形式,因為這需要在數週後重新找到同一批受測者。
評分者間信度適用於由人來評分的工具,例如臨床晤談、投射技術、行為觀察。它探問兩位經過訓練的評分者在觀察同一份材料時,是否會得出相同的結論。
複本信度探問同一測驗的兩個不同版本(設計為等同版本)是否會產生相同的得分。凡是測驗需要施測多次、且擔心題目曝光的情況,這一點都很重要。
如何解讀這些數字
信度係數的範圍從0到1。相關的判斷標準較為粗略且常被誤用,但大致而言:當得分會影響個人生活時,需要高於0.90;0.80到0.90對大多數應用情境而言是穩固的;0.70到0.80對研究和群體比較而言是可接受的;而低於0.70則意味著該得分所包含的噪音,已多到大多數結論都無法承受。
關於這些門檻,有兩點提醒。第一,它們是慣例,而非定律;可接受的水準完全取決於這個得分將被如何使用。第二,一個很短的量表若alpha值非常高,通常表示這些題目彼此幾乎是同義改寫,這雖然換來了一致性,卻是以犧牲對構念的涵蓋範圍為代價。一個由十道題目組成、全都用略微不同的措辭問「你有條理嗎?」的量表,會有極佳的內部一致性,但對嚴謹性這個特質的測量卻十分狹隘。
這對你自己的得分意味著什麼
信度直接轉化為單一數字值得多少信任。信度為0.85的測驗,其測量誤差之大,足以讓兩個人之間、或你今天的得分與上個月得分之間相差幾分的差異,極有可能只是噪音,而非真正的訊號。
這帶來一個實際的後果:一個好的測驗工具會報告其信度,讓你知道你得分周圍的不確定性有多大。這種不確定性的技術性表達方式,稱為測量標準誤,它能將信度係數轉換成得分周圍的一個正負區間。
一個完全沒有報告信度數值的測驗工具,並不會因此變得更精確。它只是選擇不告訴你它有多不精確。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。