聚合效度與區辨效度
兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
聚合效度與區辨效度是同一項要求的兩個面向。一項測量必須與理論上應該相關的事物產生相關,同時也不能與應該有所區別的事物有過高的相關。只滿足其中一項而未滿足另一項並非部分成功,通常代表這個構念並非其宣稱的樣貌。
聚合效度
聚合證據顯示某項測量與其他衡量同一事物的指標一致。一份新的焦慮量表應該與已建立的焦慮量表、臨床醫師評分,以及理想上與非問卷形式的指標(例如生理測量或觀察到的迴避行為)有實質相關。
此處的相關係數通常預期高於 0.50,當比較的測量是衡量同一構念的成熟工具時,常會高於 0.70。若低於此範圍,則新量表或比較對象所測量的可能是另一種事物。
這裡有個陷阱。與現有量表的相關係數達到 0.95 並非成就,而是表示這項新工具只是重新包裝而已,誠實的問題應該是它究竟增添了什麼。聚合效度是一項底線,而非要極力追求的目標。
區辨效度
區辨證據顯示該測量與其宣稱有所區別的構念之間確實保持分離。這正是有趣的失敗案例所在之處。
這種模式在文獻中反覆出現。「恆毅力」(Grit)與嚴謹性的相關係數約為 0.84,已相當接近,以致於後設分析發現,在控制嚴謹性之後,它對學業預測幾乎沒有額外貢獻。自陳量表式情緒智力與情緒穩定性、外向性及嚴謹性三者合併之間有大量重疊。在黑暗三特質(Dark Triad)中共有的變異量,一旦納入 HEXACO 模型中的誠實正直性(Honesty-Humility)之後,大部分便消失了。在每個案例中,該構念原本被視為新的領域,結果卻只是既有版圖中一個換了名字的區域。
區辨效度也是方法效應浮現的地方。如果一項研究中每個自陳構念彼此的相關係數都是 0.4,那麼共同因子很可能是受試者的回答風格,而非任何共有的心理特質。
決定性的檢驗
決定性的程序是漸增效度(incremental validity):先將已建立的測量納入迴歸模型,再加入新的測量,觀察新測量是否能解釋結果變異中額外的部分。若無法解釋,該構念在理論上仍可能有趣,但這項工具並未測量出這個領域原本未曾擁有的任何事物。
這是一項嚴苛的標準,而許多已發表的量表從未接受過這樣的檢驗。當接受檢驗時,結果經常就是上述的冗餘發現。這並非醜聞,而是正常的科學修剪過程,但這確實意味著,一個構念的受歡迎程度無法告訴我們它是否經得起這項檢驗。
對讀者而言,這改變了什麼
當一項測驗報告多個得分時,有用的問題是這些得分是否真的彼此不同。四個彼此相關達 0.8 的維度,其實是一個維度貼上四個標籤,由此建立的側寫看起來雖有區別,實際上幾乎不帶有獨立的資訊。
會公開量表間相關係數的工具,讓你可以自行檢查這一點。而那些呈現四象限類型卻從未說明各象限之間關係的工具,則使這項檢查變得不可能,而這通常正是重點所在。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。