什麼是心理測驗中的效度?
效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
效度探討的是一項測驗是否真正測量到它宣稱要測量的內容,以及人們從其得分所得出的結論是否有正當依據。這是心理測量學中最核心的問題,也是最常被行銷話術而非證據來回答的問題。
自Messick於1980年代的研究以來,現代對效度的理解是:效度並非測驗工具的固定屬性,而是針對特定用途對得分所做的詮釋所具有的一種性質。同一份問卷可能在描述一個人的自我認知方面具有良好效度,卻在決定是否錄用該人方面完全沒有效度。若只說「這個測驗是有效的」,卻不說明是針對什麼而有效,那並不是一種主張,而只是一句口號。
證據的種類
效度是由多種類型累積的證據所建構而成。較舊的文獻將這些視為效度的不同種類;而目前的觀點則將它們視為支持同一個論點的不同論證。
內容證據探討的是題目是否適當地涵蓋了該構念。一份只詢問睡眠和食慾的憂鬱量表,涵蓋了身體症狀,卻遺漏了情緒與認知方面的症狀。內容涵蓋範圍通常由該領域的專家來判斷,這也是為什麼極短的量表總是一種妥協。
內部結構證據探討的是題目分組的方式是否符合理論的預期。如果一個模型宣稱有四個獨立的面向,因素分析應該要找出四個因素,而且關鍵是,要在一個獨立樣本中找到,而不只是在該量表建構時所使用的樣本中找到。有非常多的測驗工具在其發展樣本中能重現預期的結構,卻在其他任何人的樣本中都無法重現。
與其他變項的關聯是大部分工作發生的地方。收斂證據顯示該量表與應該相關的事物確實相關。區辨證據顯示該量表與應該有所區別的事物之間,並沒有過高的相關性,這是一項長期被忽視的要求,也正是導致許多新創品牌構念站不住腳的原因。標準關聯證據顯示得分與重要的結果有關,無論是同時測得的結果,還是預先預測的結果。
後果證據探討的是測驗被使用時會發生什麼。如果某項測驗工具因與該構念無關的原因,系統性地使某個群體處於不利地位,那不僅是一個倫理問題,更是一個效度問題。
揭露大多數主張真相的問題
對效度主張最嚴格的檢驗,就是增量效度:這項測驗工具,是否比一個更便宜、更早已建立的既有量表,提供了額外的資訊?
相當多的品牌化構念在這一點上失敗了。它們與現有的五大人格維度之一的相關係數達到0.7或更高,以相同的幅度預測相同的結果,而且一旦以統計方式控制舊有量表,便不再增加任何新資訊。構念是新的,測量方式卻不是。這就是為什麼嚴謹的測驗工具文件中的批評章節,往往著重於冗餘性,而不是不準確性。
應該注意什麼
當有人聲稱某項測驗已經過驗證時,有用的問題會是具體的。是針對什麼標準驗證的?在哪種族群、多大的樣本量中驗證的?其因素結構是否在獨立樣本中得到證實?是否有由對結果沒有商業利益的研究者所發表的證據?它是否比既有的替代方案多提供了什麼?
一項測驗工具若能對這些問題給出誠實的答案,就值得認真對待,包括它的侷限性。而一項測驗工具的驗證若僅止於一頁見證推薦文,以及宣稱有數百萬人做過這項測驗,那麼它回答的其實是完全不同的問題:受歡迎程度並不是證據,做過某項測驗的人數多寡,也絲毫無法說明其得分是否具有任何意義。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。