noesisnoesis
測量如何運作

聚合效度與區辨效度

兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。

聚合效度與區辨效度是同一項要求的兩個面向。一項測量必須與理論上應該相關的事物產生相關,同時也不能與應該有所區別的事物有過高的相關。只滿足其中一項而未滿足另一項並非部分成功,通常代表這個構念並非其宣稱的樣貌。

聚合效度

聚合證據顯示某項測量與其他衡量同一事物的指標一致。一份新的焦慮量表應該與已建立的焦慮量表、臨床醫師評分,以及理想上與非問卷形式的指標(例如生理測量或觀察到的迴避行為)有實質相關。

此處的相關係數通常預期高於 0.50,當比較的測量是衡量同一構念的成熟工具時,常會高於 0.70。若低於此範圍,則新量表或比較對象所測量的可能是另一種事物。

這裡有個陷阱。與現有量表的相關係數達到 0.95 並非成就,而是表示這項新工具只是重新包裝而已,誠實的問題應該是它究竟增添了什麼。聚合效度是一項底線,而非要極力追求的目標。

區辨效度

區辨證據顯示該測量與其宣稱有所區別的構念之間確實保持分離。這正是有趣的失敗案例所在之處。

這種模式在文獻中反覆出現。「恆毅力」(Grit)與嚴謹性的相關係數約為 0.84,已相當接近,以致於後設分析發現,在控制嚴謹性之後,它對學業預測幾乎沒有額外貢獻。自陳量表式情緒智力與情緒穩定性、外向性及嚴謹性三者合併之間有大量重疊。在黑暗三特質(Dark Triad)中共有的變異量,一旦納入 HEXACO 模型中的誠實正直性(Honesty-Humility)之後,大部分便消失了。在每個案例中,該構念原本被視為新的領域,結果卻只是既有版圖中一個換了名字的區域。

區辨效度也是方法效應浮現的地方。如果一項研究中每個自陳構念彼此的相關係數都是 0.4,那麼共同因子很可能是受試者的回答風格,而非任何共有的心理特質。

決定性的檢驗

決定性的程序是漸增效度(incremental validity):先將已建立的測量納入迴歸模型,再加入新的測量,觀察新測量是否能解釋結果變異中額外的部分。若無法解釋,該構念在理論上仍可能有趣,但這項工具並未測量出這個領域原本未曾擁有的任何事物。

這是一項嚴苛的標準,而許多已發表的量表從未接受過這樣的檢驗。當接受檢驗時,結果經常就是上述的冗餘發現。這並非醜聞,而是正常的科學修剪過程,但這確實意味著,一個構念的受歡迎程度無法告訴我們它是否經得起這項檢驗。

對讀者而言,這改變了什麼

當一項測驗報告多個得分時,有用的問題是這些得分是否真的彼此不同。四個彼此相關達 0.8 的維度,其實是一個維度貼上四個標籤,由此建立的側寫看起來雖有區別,實際上幾乎不帶有獨立的資訊。

會公開量表間相關係數的工具,讓你可以自行檢查這一點。而那些呈現四象限類型卻從未說明各象限之間關係的工具,則使這項檢查變得不可能,而這通常正是重點所在。

付諸實測

閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。

繼續閱讀

聚合效度與區辨效度 | NOESIS