noesisnoesis
測量如何運作

常模與百分位數:您的得分是與什麼進行比較

原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。

你在嚴謹性量表上得到34分。這樣算高嗎?

這個問題若沒有比較基準就無法回答。34分是滿分多少中的34分?相對於誰?是在什麼時候測量的?常模就是將原始得分轉換為可解讀位置的參照資料,而選擇常模是測驗編製過程中最具影響力的決定之一。

換算方式如何運作

常模樣本是一群在標準條件下接受該測驗工具的人,他們的得分分佈成為衡量的標準。原始得分接著會以在該分佈中的位置來表示。

百分位數表示常模樣本中得分等於或低於你的比例。第70百分位數表示該參照群體中有70%的人得分較低。百分位數雖然直觀,卻有一個常被忽視的缺點:它會拉大分佈中間密集區域的差異,同時壓縮兩端的差異。平均值附近的幾分原始得分變動,可能讓你的百分位數大幅移動;而在頂端附近的相同幾分變動,卻幾乎不會造成任何改變。

標準分數,例如z分數、T分數、標準九分、智商式量尺,以標準差為單位表達與平均值的距離。它們保留了得分之間的實際間距,因此在需要對結果進行數值運算時更受偏好。

為何參照群體才是關鍵所在

同一個原始得分,根據所使用的常模樣本不同,可能落在截然不同的百分位數上。以一般成年人群體與執業會計師樣本分別作為常模來評估嚴謹性,得出的百分位數不會相同,但兩者都沒有錯:它們回答的是不同的問題。

這使得常模樣本的幾項特性值得了解。

樣本中有誰。 以心理學大學生作為便利樣本的情況仍然常見,而這只代表人類中很狹窄的一部分:年輕、受過教育,且過度集中於富裕的西方國家。以此建立的常模適用性有限。

樣本規模多大。 在分佈尾端要獲得穩定的百分位數估計,需要龐大的樣本。只有幾百人,無法可靠地呈現第95百分位數的實際樣貌。

收集的時間。 常模會隨時間漂移。許多心理測量指標的總體平均值在數十年間出現了可測量的變化,因此1995年建立的常模樣本,已無法描述2026年接受測驗的群體。

是否分層。 許多特質會隨年齡和性別系統性地變化。尋求刺激的傾向會隨年齡增長而明顯下降;生理時型(chronotype)也會隨人生階段轉變。若將55歲的人與涵蓋所有年齡的常模相比較,無論哪個特質都會得出誤導性的位置。

該注意什麼,以及缺乏這些資訊代表什麼

一份文件記載完善的測驗工具,會說明其常模樣本的規模、構成、所屬國家與年份,並說明常模是否有分層。嚴謹的測驗手冊會為此專闢章節說明。

大多數免費的線上測驗完全不會提供這些資訊。它們只給你一個百分位數,卻不說明這個數字所指的是哪個群體。這個百分位數,可能來自未經說明的便利樣本,可能是借用自其他群體所建立的公開常模,也可能是根據該網站先前所有受測者計算出來的:這是一個連網站經營者自己也不清楚其構成的自我選擇群體。

這個百分位數依然會顯示在螢幕上,看起來與真正的百分位數毫無二致。唯一能區分兩者的,只有隨附的說明文件。

付諸實測

閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。

繼續閱讀