自陳量表能測量與不能測量的範圍
問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
幾乎所有廣泛使用的人格與幸福感測驗工具,都是自陳量表問卷。你閱讀一則陳述,評估它有多符合你的情況,然後將這些評分加總。這種方式成本低、速度快、易於擴展,也確實有其優點,但也存在一些值得在你閱讀自己的結果之前先了解的失效模式。
適用良好之處
**他人無法觀察到的內在狀態。**生活滿意度、感受到的壓力、意義感、感受到的焦慮。對這些構念而言,本人不僅是方便的資料來源;他們是唯一有效的來源。若由觀察者評定你的主觀幸福感,那只是猜測。
**長期累積下來的典型行為。**人們相當擅長報告自己通常會做的事,即便他們不擅長預測任何單一情境下的行為。特質測量之所以有效,正是因為它是對多次場合的平均。
**自我認知本身作為研究對象。**你認為自己有多有能力,會影響你嘗試去做什麼,這與你實際上有多有能力是獨立的。自我效能之所以是一個合理的構念,正是因為這種信念會帶來實際後果。
失效之處
**社會期許反應。**人們報告自己比實際上更盡責、更有同理心、更少敵意,而這種效應會隨著利害關係的增加而擴大。在低利害關係的自我認識情境中,扭曲程度較為輕微。但在招募情境中,扭曲程度則相當嚴重:大多數人格題目用詞直白,容易被刻意作答扭曲,而最有動機扭曲答案的應試者,正是雇主最想辨識出來的人。
**有限的自我洞察。**自陳報告與熟悉當事人的知情者報告之間,僅呈現中等程度的相關,而落差最大之處恰恰是可預期的:在具有評價意涵的特質上,以及在自我認知最不準確的人身上。一個人若沒有察覺自己的不專注,就難以準確報告這一點。
**能力與信念之別。**自陳量表無法測量能力。自陳的情緒智力,測量的是你認為自己有多具情緒能力,這與需要情緒判斷任務上的實際表現,僅呈現中等程度的相關。這兩者都是真實存在的構念;但它們並非同一件事,將二者混為一談,是商業測驗市場中最常見的錯誤之一。
參照群體效應。「我工作很努力」這句話,是相對於某個隱含的比較群體來評分的,而這個比較群體會因人而異、因文化而異。這使得跨文化比較自陳量表的原始平均分數變得不可靠,而這種不可靠往往容易被忽略,也很難修正。
**作答當下的情緒狀態。**當下的情緒會系統性地影響回溯性判斷。對於一個理應穩定的構念,單次測量所得的得分,其所含的狀態變異程度,往往比特質框架所暗示的更高。
反應風格。「同意傾向」,也就是不論內容如何都傾向同意,以及極端反應傾向,會因個人與文化而有差異。設計良好的量表會以反向措辭題目來減緩此問題,但這也引入了自身的假象:混合措辭的量表經常會產生一個虛假的第二因子,反映的是措辭方式,而非實際內容。
如何在了解這些之後閱讀自己的結果
請將自陳量表的得分,視為對「你如何看待自己」的一份結構良好的說明,這確實具有參考價值,但並不等同於「你實際上是怎樣的人」的說明。
這兩者之間的落差,往往才是最值得關注的部分。當某個得分讓你感到意外時,值得深思的問題不是這份測驗是否錯了,而是在你身邊的人之中,會有多少人認同這兩種說法,也就是你自己的看法,或是測驗工具的看法。
這也是問卷本身所能提供資訊的誠實界限,也是為什麼你應該將任何單一得分,視為眾多參考資訊之一,而不是最終定論的理由。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。