為什麼大多數網路人格測驗不可靠
並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
一個免費的線上人格測驗,跟一個經過驗證的心理計量工具,產出的結果看起來一模一樣:一個分數、一個百分位數、一段描述你的文字。差別完全在於結果畫面上看不到的那些工作。
這一點值得說清楚,因為一般的說法——網路測驗都是騙局——大部分是錯的,也沒什麼幫助。多數測驗的製作者並沒有欺騙的意圖。它們不可靠,是出於結構性的原因。
通常被省略的部分
**題目分析。**在一個建構完善的量表中,大部分草擬的題目在試測後會被淘汰:沒有人作答有差異的題目、與總分相關性不佳的題目、同時負荷在多個因子上的題目、在不同年齡或語言群體中表現不一致的題目。一個未經試測就發表的測驗,會保留所有題目,包括那些不管用的。
**獨立的結構驗證。**用你建構量表時所用的資料做因子分析,當然會得出你原本設計的結構。要在一個全新的樣本中確認這個結構,是另外一項獨立的研究,而這正是大部分量表會失敗的步驟。
**常模。**百分位數必須有個來源。如果網站沒有說明其參照的族群,這個數字就是根據先前的訪客——一群自我選擇、組成不明的人——推算出來的,或者根本沒有依據。
**重測資料。**要確立人們下個月的得分維持一致,需要再次找到他們。幾乎沒有人這麼做,這意味著「特質」這個詞所暗示的穩定性,並未經過證實。
設計上的動機走錯了方向
為提高互動而設計的測驗,其優化目標與為求準確而設計的測驗不同,兩者會以可預測的方式漸行漸遠。
討喜的結果表現得更好。一個告訴你不受歡迎事實的結果,被分享的次數會較少,因此結果會逐漸偏向每個人都能在自己身上認出的描述。這就是巴納姆效應,早在1940年代就已被證實,此後也不斷被可靠地重現:人們會將籠統的人格描述評為,特別精確地描述了他們自己。
類型比維度表現得更好。「你是個建築師型」比「你在開放性上位於第68百分位數,且信賴區間相當寬」更容易被分享。類型也會掩蓋測量誤差,因為一個剛好落在類別邊界兩側的人,會得到完全不同的標籤。
短的比恰當的表現得更好。每多一道題目就會流失受測者,因此測驗會被刪減到能讓完成率最大化的長度,而不是能完整涵蓋該構念的長度。
這些都不是謊言。它們是針對準確性以外的另一個指標所做的優化。
大約三十秒內如何辨別
找看看是否有具名的來源工具,附上作者和年份。找看看有沒有說明常模來自哪個族群。找看看有沒有承認任何限制或測量誤差。看看結果是連續分數還是分類。看看同一頁面是否也承諾能從二十道題目中,找出你理想的職業、伴侶或人生目標。
一個會標明所使用工具、引用其來源、說明其常模,並說明其無法告訴你什麼的測驗,是做足了功課的。一個什麼都沒做的測驗,可能仍是打發五分鐘的愉快方式,但它產出的數字只是裝飾。
NOESIS 目錄中的每一項工具,都會說明它所實作的是哪一份已發表的測驗、由誰撰寫、在哪一年撰寫、如何計分,以及其結果無法確立哪些事。最後這一點,正是值得拿來比較的重點。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。