常模與百分位數:您的得分是與什麼進行比較
原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
你在嚴謹性量表上得到34分。這樣算高嗎?
這個問題若沒有比較基準就無法回答。34分是滿分多少中的34分?相對於誰?是在什麼時候測量的?常模就是將原始得分轉換為可解讀位置的參照資料,而選擇常模是測驗編製過程中最具影響力的決定之一。
換算方式如何運作
常模樣本是一群在標準條件下接受該測驗工具的人,他們的得分分佈成為衡量的標準。原始得分接著會以在該分佈中的位置來表示。
百分位數表示常模樣本中得分等於或低於你的比例。第70百分位數表示該參照群體中有70%的人得分較低。百分位數雖然直觀,卻有一個常被忽視的缺點:它會拉大分佈中間密集區域的差異,同時壓縮兩端的差異。平均值附近的幾分原始得分變動,可能讓你的百分位數大幅移動;而在頂端附近的相同幾分變動,卻幾乎不會造成任何改變。
標準分數,例如z分數、T分數、標準九分、智商式量尺,以標準差為單位表達與平均值的距離。它們保留了得分之間的實際間距,因此在需要對結果進行數值運算時更受偏好。
為何參照群體才是關鍵所在
同一個原始得分,根據所使用的常模樣本不同,可能落在截然不同的百分位數上。以一般成年人群體與執業會計師樣本分別作為常模來評估嚴謹性,得出的百分位數不會相同,但兩者都沒有錯:它們回答的是不同的問題。
這使得常模樣本的幾項特性值得了解。
樣本中有誰。 以心理學大學生作為便利樣本的情況仍然常見,而這只代表人類中很狹窄的一部分:年輕、受過教育,且過度集中於富裕的西方國家。以此建立的常模適用性有限。
樣本規模多大。 在分佈尾端要獲得穩定的百分位數估計,需要龐大的樣本。只有幾百人,無法可靠地呈現第95百分位數的實際樣貌。
收集的時間。 常模會隨時間漂移。許多心理測量指標的總體平均值在數十年間出現了可測量的變化,因此1995年建立的常模樣本,已無法描述2026年接受測驗的群體。
是否分層。 許多特質會隨年齡和性別系統性地變化。尋求刺激的傾向會隨年齡增長而明顯下降;生理時型(chronotype)也會隨人生階段轉變。若將55歲的人與涵蓋所有年齡的常模相比較,無論哪個特質都會得出誤導性的位置。
該注意什麼,以及缺乏這些資訊代表什麼
一份文件記載完善的測驗工具,會說明其常模樣本的規模、構成、所屬國家與年份,並說明常模是否有分層。嚴謹的測驗手冊會為此專闢章節說明。
大多數免費的線上測驗完全不會提供這些資訊。它們只給你一個百分位數,卻不說明這個數字所指的是哪個群體。這個百分位數,可能來自未經說明的便利樣本,可能是借用自其他群體所建立的公開常模,也可能是根據該網站先前所有受測者計算出來的:這是一個連網站經營者自己也不清楚其構成的自我選擇群體。
這個百分位數依然會顯示在螢幕上,看起來與真正的百分位數毫無二致。唯一能區分兩者的,只有隨附的說明文件。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。