什麼是建構效度?
測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
建構效度探討的是,一項測驗工具是否測量了它宣稱要測量的理論構念,而不是與該構念相關的某種東西、比該構念更狹隘的某種東西,或根本毫無條理的東西。這是效度證據中最深層的一種形式,需要花費數年而非一項研究才能建立起來。
困難之處在於結構性的。像韌性或情緒智商這樣的構念並非一個具體的物件,而是行為中被提出的某種規律性。要證明一個量表測量了它,你必須同時捍衛兩個主張:該構念確實如所描述的方式存在,以及這些特定題目確實觸及了它。這兩個主張無法分開處理,這正是為什麼在1955年提出這個概念的Cronbach和Meehl,將其定義為檢驗整個理論網絡,而不僅僅是一個測驗工具。
論證是如何建立的
預測的相關性模式。 理論說明了該構念應該與哪些事物相關,以及相關程度有多強。自我同情應該與生活滿意度呈正相關,與憂鬱呈負相關,而與自尊只呈中度相關,如果它與自尊的相關性高達0.9,那麼它就不是一個獨立的構念。每一項這樣的預測都是一個可檢驗的主張,而任何一項失敗都具有資訊價值。
預期的群體差異。 如果理論指出某項特質會隨年齡發展,或在臨床群體中會升高,那麼該測驗工具應該能顯示出這一點。若找不到理論所要求的差異,這就是不利於該測驗工具、該理論,或兩者皆有問題的證據。
對介入措施的反應。 如果某個構念應該是可以透過訓練改變的,那麼得分應該在訓練後有所變動,而在對照組中則不應變動。從不對任何事物產生反應的構念,很難與人為假象區分開來。
內部結構。 因素結構應該與理論化的結構相符,而且重要的是,要在一個全新的樣本中相符。對開發資料進行的探索性因素分析,會找到任何被設計出來的結構;而對新資料進行的驗證性分析,才是真正檢驗這個主張的地方。
多特質多方法的概念
Campbell和Fiske在1959年的貢獻,是堅持建構效度需要同時滿足兩件事:透過不同方法測量同一特質的結果應該一致,而透過同一方法測量不同特質的結果則不應該一致。
第二部分正是大多數測驗工具困難的所在。如果你自陳的同理心與你自陳的親和性相關性達到0.7,而與觀察者評定的同理心相關性只有0.2,那麼你的問卷所測量到最強烈的東西並非同理心,而是你在問卷上描述自己的一般方式。方法變異是自陳量表研究中最持久的問題之一,這也是為什麼嚴謹的驗證工作,只要有可能,就會尋求非問卷形式的效標。
為什麼這在閱讀你的結果時很重要
建構效度是站在得分與其解讀之間的關鍵。當一個經過良好驗證的測驗工具報告你在某項特質上得分偏高時,這句話背後的推理鏈條,包含了數十年來已發表的研究成果,這些成果確立了該特質作為一個具有條理的量的行為方式、這些題目確實追蹤了它,以及這個得分在接受測驗的人之間具有相似的意義。
當一項沒有經過建構效度驗證的測驗報告同樣的結果時,這個得分只是一個沒有人檢驗過的演算法所產生的數字。兩者在結果畫面上看起來完全相同。差異完全存在於文件記錄之中,這正是為什麼值得去尋找這些文件記錄的原因。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。