什麼是 Cronbach's alpha,以及它不是什麼
這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
Cronbach's alpha 是一種內部一致性係數:衡量量表上各題目彼此相關的程度。此係數於1951年發表,是被引用最多的單一心理計量統計指標,而其普及程度早已超出其實際效用。
Alpha 值介於0到1之間,受兩個因素影響:題目間的平均相關性,以及題目數量。第二個因素正是大多數誤解的根源。
高 alpha 值不代表什麼
不代表量表測量的是單一構念。 這是最常見的錯誤。只要題目整體上有足夠的相關性,即使量表包含兩三個不同的因子,alpha 值仍可能很高。單一維度性必須透過因素分析來確立;alpha 無法確立這一點,也從未打算用於此目的。
不代表量表具有效度。 Alpha 完全無法說明題目測量的是什麼。二十個關於鞋子尺寸的問題會有極佳的內部一致性,但作為心理測量指標卻毫無效度。
不代表量表品質良好。 由於 alpha 值會隨題目數量增加而上升,一份由普通題目組成的長量表,得分可能會超過由優質題目組成的短量表。一份包含四十題、題目間平均相關性只有0.2的量表,alpha 值可能高於0.90。
極高的 alpha 值往往是一種警訊。 當 alpha 值超過約0.95時,通常意味著題目彼此近乎是同義改寫。這雖然換來了一致性,卻犧牲了構念涵蓋範圍:量表雖能極精確地測量某個狹窄的層面,卻遺漏了該構念的其他部分。這稱為衰減悖論(attenuation paradox),也是為何一致性並非越高越好的原因。
它的前提假設
Alpha 是在特定假設下對信度的下限估計,此假設稱為「tau等值性」(tau-equivalence),意指每個題目對潛在特質的貢獻都相等。實際的量表幾乎從不符合此假設。題目在因子上的負荷強度各不相同,而當這種情況發生時,alpha 會低估實際的信度。
McDonald's omega 捨棄了「等貢獻」的假設,而是根據實際的因子負荷量來估計信度。心理計量方法學家已推薦以 omega 取代 alpha 長達二十年之久。然而報告實務的跟進步伐緩慢,主要原因是 alpha 在每個統計套件中都只需一行程式碼即可得出,而 omega 卻不然。
實務上如何解讀
粗略的慣例是:0.70以上適用於比較群體的研究,0.80以上適用於應用場合,0.90以上則適用於得分會影響個人決策的情況。請將這些數值視為參考方向,而非絕對門檻,所需的水準取決於該得分所影響決策的重要程度。
更具參考價值的數據通常就在同一篇論文的其他地方。題目間平均相關性(0.15到0.50為健康範圍)能告訴你高 alpha 值究竟來自題目品質還是題目數量。題目數量則能從另一個角度說明同樣的問題。重測信度則能告訴你 alpha 在結構上無法揭示的資訊:同一個人的得分是否隨時間保持穩定。
一份只報告 alpha 值的量表,所報告的正是信度指標中最容易取得、也最容易通過的那一項。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。