noesisnoesis
框架比較

MBTI 具有科學性嗎?

誠實的答案比單純的「是」或「否」更為具體:這份問卷本身的建構相當合理,但它所依據並回報的類型理論卻缺乏支持。這兩項事實通常被混為一談,壓縮成單一論點。

麥布二氏類型指標(Myers-Briggs Type Indicator)是全世界最多人接受的人格測驗工具,也是學術人格心理學最不重視的一種。這兩個事實都值得說明,因為雙方論點的通俗版本都有問題。

這些批評實際證明了什麼

二分類別並非真正的二分。 這是最有力的反對意見,而且基本上無可爭議。MBTI 會把您歸類為 E 或 I、T 或 F。如果這些是真實的類別,每個維度上的得分應該會聚集成兩個峰,中間有明顯的間隔。但實際情況並非如此。分布是單峰的,大多數人都接近中間值,而類型的分界線恰好切過分布最密集的部分。

實際後果相當嚴重。某人只要在分界線任一側偏移一分,就會被歸為不同的字母、不同的四字母類型,儘管在統計上兩者根本無法區分。這不是細微的統計爭議,而正是為什麼同一個人在合理情況下可能得出兩種不同的類型。

再測分類的一致性不佳。 幾週後重新測驗的研究發現,相當一部分受測者(常見報告約三分之一到一半)至少會得到一個不同的字母,因此得到不同的類型。對於一項整體輸出就是「穩定類型」的測驗工具來說,這是個嚴重的問題。請注意其機制:這正是二分化本身直接造成的結果。底層的連續得分其實相當穩定;問題出在把它們硬性切割在某個分界點上,這才製造出不穩定性。

第四個維度的支持證據薄弱。 判斷型-感知型(Judging-Perceiving)是伊莎貝爾.麥爾斯(Isabel Myers)在榮格理論之外新增的部分,並非原始理論的一部分,四個維度中它的實證基礎最為薄弱。

該理論屬於前實證階段的產物。 榮格的類型理論來自 1920 年代的臨床觀察與內省,並非從資料中推導而來,也不是為了被驗證而建構的。這並非在批評榮格本人,因為他做的是另一種性質的工作;這只是在描述這種主張屬於哪一類。

在最常被宣稱的用途上,預測效度薄弱。 MBTI 在團隊組成與職涯輔導方面被大力行銷。但關於類型能預測工作表現或團隊效能的證據十分薄弱,甚至該測驗的出版商自己都建議不要將其用於人才選用。

這些批評並未證明什麼

問卷本身並非設計不良。題目層級的心理計量特性相當不錯,四個量表的內部一致性普遍可接受,而且題目的開發過程比通俗批評所暗示的要更用心。

更有意思的是,底層的連續維度與既有特質有明顯的對應關係。E-I 與外向性高度相關。T-F 與親和性有相當程度的對應。J-P 與嚴謹性有相當程度的對應。S-N 與開放性相對應。四個維度中有三個,其實捕捉到的變異量與五大人格模型所測得的相同。

所以問題不在於測量本身。問題在於測量之後如何被使用:連續得分被切割成類別,類別被賦予名稱,而這些名稱又被當作是某種「人的類型」來對待。

為何它依然廣受歡迎

因為它讓人愉悅。十六種類型中的每一種都被描述得正面,沒有一種是「不好」的類型,而且描述的語句概括性極高,以至於大多數人都能在其中認出自己,這正是巴納姆效應(Barnum effect)如文獻所記載的那樣,恰如其分地發揮作用。

它也為團隊提供了一套共同、不具威脅性的詞彙。顧問們回報說,這在促進團隊互動上確實有實際用處,也沒有理由懷疑他們的說法。這是一種合理的用途,與這些類型是否「真實存在」完全無關。

合理的結論

接受 MBTI 測驗並無害處,閱讀自己類型描述的體驗也並非毫無價值。但將類型作為招募、升遷、團隊分配或職涯方向的依據,並沒有證據支持,而且出版商自己也同意這一點。

如果您想從人格測驗工具中得到一個經得起檢驗的測量結果,證據所在之處是五大人格模型:連續得分而非類型,四十年來獨立重複驗證的研究、已發表的常模,以及有記錄可查的測量誤差。NOESIS 在目錄中所發布的五大人格測驗工具,皆註明了其資料來源與限制,這正是值得您自行比較的對象。

付諸實測

閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。

繼續閱讀