什麼是心理計量學?
這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
心理計量學是心理學的一個分支,關注的是測量本身。並非探討外向性的意義為何,而是探討一組特定的問題是否真的能測量外向性,得出的數字中含有多少誤差,以及這個數字有資格預測什麼。
這個區別比聽起來更重要。任何人都可以寫二十個關於一個人有多外向的問題,然後把答案加總起來。心理計量學的工作是接下來要做的事:證明這二十個問題彼此相關,證明它們測量的是一件事而不是三件事,證明同一個人下個月的得分大致相同,證明得分與這個人實際的行為表現有關,並證明整套機制對里斯本的22歲人士和慕尼黑的55歲人士都同樣有效。
為何需要一門學科
物理測量有一個心理學所沒有的優勢:你可以拿一根公尺尺放在被測量的物體旁邊。但沒有一根公尺尺可以測量嚴謹性。這種特質無法直接觀察,它是從行為中推論出來的,而問卷回答只是在這之上再加一層推論。
這正是心理計量學家所稱的潛在變項:一種真實到足以產生後果,卻只能透過間接指標來觸及的東西。整套方法論機制的存在,正是因為這種間接性。你會遇到的每一種技術,例如因素分析、信度係數、試題反應理論、常模樣本,都是試圖對一個沒有人能直接觀察到的量,說出一些站得住腳的話。
三個問題
剝去專業術語,心理計量學對任何測驗工具都問三件事。
它是否一致? 如果測量結果大部分都是噪音,其他一切都不重要。一致性要在題目之間檢驗(這些問題彼此是否吻合?)、在時間上檢驗(同一個人下個月的得分是否相同?),以及在相關情況下跨評分者檢驗。這就是信度。
它測量的是它聲稱要測量的東西嗎? 一份問卷可以完全一致,卻仍然測量錯了東西。一個聲稱測量領導潛能的量表,如果與單純的自尊心相關係數達0.8,那它測量的其實是自尊心。這就是效度,它不是一個測驗工具擁有或不擁有的特性,而是一個由累積證據所建構出來的論證。
與誰比較? 34分這個原始得分本身沒有任何意義。它只有在對照一個參照群體時才能被解讀:34分相對於哪個群體來說算高?在何時測量?在何地測量?這是常模的工作,而這正是大多數消費型測驗完全略過的步驟。
良好做法應該是什麼樣子
一份製作精良的測驗工具會有完整的文件記錄。有人公開發表過這些題目是如何撰寫的,哪些題目被捨棄了。有人在具名的樣本中,以樣本大小為依據,報告了信度係數。有人測試過這個因素結構在第二個、獨立於原始建構樣本之外的樣本中是否依然成立。有人檢查過這些題目在不同語言和年齡群體中的表現是否一致。還有其他人,最理想的情況是與這個測驗工具毫無利害關係的人,嘗試複製這些研究發現,並報告了結果。
這些都不能讓一個測驗變得絕對可靠。但它們讓這個測驗的限制變得可以被了解,這是一種不同、也更有用的特性。一個記錄了測量誤差的測驗工具,能告訴你在多大程度上可以信任兩個得分之間的微小差異。一個沒有公開誤差估計值的測驗工具,並不代表它更準確,只是它對於自身的不準確保持沉默而已。
對讀者而言,這意味著什麼
心理計量學不會告訴你一個測驗是真實的。它會告訴你一個得分可以被延伸到多遠,超過那個界限它就不再具有任何意義,它能回答哪些問題,它是根據哪些群體校準的,以及差異必須達到多大才值得注意。
這比大多數人格測驗產品所做出的承諾要更為有限。但這也是唯一一個在面對證據時仍能站得住腳的承諾。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。