心理測驗實際上是如何建構的
從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
一項能夠發表的心理測量工具,通常經歷了五到六年的研究過程,並捨棄了大部分曾被撰寫出來的內容。了解這個過程的順序是值得的,因為其中每個階段都對應著一種測驗可能存在缺陷的方式。
1. 定義構念
在撰寫任何題目之前,構念必須被界定得足夠精確,以便能夠說明哪些內容不屬於其範疇。這意味著需要有一個定義、一份關於維度結構的說明(是單一維度還是多個維度,如果是多個維度,它們之間的關係為何),以及明確說明該構念意圖與哪些相鄰構念有所區別。
省略這個階段是大多數重複性測驗工具產生的根源。一份僅憑對概念的直覺感受所建構出來的量表,最終往往只是以新名稱測量既有的特質。
2. 產生題目庫
題目的初稿數量通常遠超過最終會保留下來的數量,一般是最終題數的三到五倍。這些題目來自理論、既有測驗工具、對具有該經驗之受訪者的訪談,以及該主題領域的專家。
在這個階段,題目庫會針對內容涵蓋範圍(是否涵蓋整個構念,或只集中在某一面向?)、閱讀難度、雙重問句的措辭,以及實際上是在詢問其他事物的題目進行檢視。
3. 試測與刪減
題目庫會先施測於第一個樣本。這個階段的分析主要是刪減性的。
幾乎沒有變異性的題目會被刪除,因為如果每個人都給出相同答案,這樣的問題無法區分任何人。與總分相關性不佳的題目會被刪除。同時負荷在多個因子上的題目會被刪除。在不同人口統計群體之間,因與該特質無關的原因而表現不同的題目(即差異試題功能,differential item functioning)也會被刪除,而這項檢驗正是最常被省略的步驟之一。
最終保留下來的題目,通常只有原本撰寫數量的三分之一。
4. 在新樣本中確認結構
這是區分嚴謹測驗工具與其他工具的關鍵步驟。對開發樣本進行因子分析,必然會還原出當初設計的結構,因為題目本就是被挑選出來以產生這樣的結構。真正的考驗在於使用獨立樣本進行驗證性因子分析。
許多已發表的量表,其預期結構只能在用於建構該量表的資料中被還原出來。當其他人收集新的資料時,這些因子便無法重現。這種失敗情況相當常見,以致於「該結構是否在獨立樣本中得到確認?」成為評估任何測驗工具時最有效的問題之一。
5. 累積效度證據
與測量相同構念的既有工具之間的相關性。與應有所區別的構念之間的相關性,這類相關性最好較低。與重要結果之間的關聯性。相較於既有工具的增量效度。在適合該構念的時間間隔內的重測穩定性。
這個階段沒有終點。只要該測驗工具仍在使用,這個過程就會持續下去,而測驗工具也最常在發表多年後,在這個環節被發現有所不足。
6. 建立常模
需要一個對目標人群而言足夠大且具代表性的參照樣本,並在特質隨年齡或性別而變化之處進行分層,同時記錄年份與國家資訊。此後還需定期重複進行,因為常模會隨時間產生變化。
7. 若將於其他地區使用,則進行翻譯
翻譯並非單純的語言練習。恰當的調適過程包括正向翻譯、獨立的回譯、專家審查、與目標語言使用者進行認知訪談,然後在新語言中進行全新的心理測量研究,以檢驗結構是否成立,以及題目是否具有等同的作用。若一項測驗工具未經過這樣的研究就進行翻譯,那麼無論其原版本擁有何種公信力,在該語言中它仍是一項未經檢驗的工具。
這對速成小測驗意味著什麼
一份在一個下午內寫成的測驗,只完成了第二個步驟。它很可能會產生看似合理的結果,一個百分位數以及一段描述性文字。而它所省略的步驟,正是那些能夠確立這一切是否真正具有意義的關鍵環節。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。