當一項測驗被稱為「已驗證」時,這代表什麼意思?
這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
「經過科學驗證」並不是一個受保護的用語。沒有任何機構為其認證,也沒有任何機構稽核,而它卻出現在一些產品上,這些產品全部的證據基礎僅僅是「很多人做過這個測驗」。了解這個詞在正確使用時究竟代表什麼意義,是有價值的。
簡短版本
一項經過驗證的工具,會有公開發表的紀錄,說明它測量的是什麼、精確度如何、適用於哪些族群,以及其得分可以合理用於什麼目的。驗證不是一張證書,而是一套通常經過多年累積的證據體系,通常還包含限制該工具使用範圍的發現,而不只是對它有利的結論。
有記錄在案的限制,正是較佳的訊號之一。真正的驗證文獻中充滿了這類內容:這個量表在青少年身上表現不佳、那個面向無法複製、切截點會因族群而異。一個只報告優點的產品,並沒有發表它的驗證,它發表的是它的行銷。
四個關鍵問題
原始出版來源是什麼? 一項經過驗證的工具會有一篇原始論文,發表於同行審查期刊,附有作者、年份,通常還有DOI。這篇論文會說明題目是如何開發的,以及最初的心理計量特性是什麼。如果沒有人能說出這篇論文,那就沒有驗證可言。
結構是否經由他人確認過? 開發團隊自然會重現他們自己設計出來的結構。真正重要的是,是否有獨立的團隊,使用獨立的資料,得出了相同的結果。這是你能問的最有參考價值的單一問題,也是最常被忽略而未被回答的問題。
常模是建立在哪個族群、什麼時候建立的? 得分是在參照分佈中的一個位置。一項工具若報告百分位數卻未說明它所指的是哪個族群,那就等於給了你一個沒有分母的數字。
它增加了什麼? 相對於既有量表的增益效度。有非常多品牌化的構念在這一項上失敗,因為它們與現有特質的相關性過高,以至於在任何方面都無法解釋額外的變異。這是科學審查下的正常結果,但除非有人真正去檢驗,否則它是看不見的。
翻譯讓事情變得複雜的地方
一項在英語中經過驗證的工具,並不因此就在德語中也經過驗證。適當的跨文化調適需要正向與回譯、專家審查、認知訪談,然後在新語言中進行全新的心理計量研究,檢驗因素結構是否仍然成立,以及個別題目在不同群體間是否具有等同的功能。
跳過這個步驟的工具很常見。一份原始驗證無可挑剔的問卷,在某個語言中若有一個關鍵題目帶有不同的意涵,其表現可能會截然不同,而沒有相關研究的話,根本無從得知。當一項測驗以十種語言提供時,值得問的問題是:它是在十種語言中都經過驗證,還是只在一種語言中驗證後翻譯成另外九種。
驗證買不到什麼
它並不能讓得分變得確定無誤。一項經過驗證的工具仍然帶有測量誤差,仍然描述的是族群層級的規律性,而不是個人的命運,並且仍然只能測量其題目所能觸及的內容。
驗證所帶來的,是可知的限制。你可以查明誤差有多大、適用於哪個族群、適用於什麼目的。這比「這個測驗揭露了你真正是誰」的說法要保守得多,但也是唯一站得住腳的說法。
如果你想看看文件存在時應該是什麼樣子,NOESIS 目錄中的每一項測驗都會標明它所依據的工具、其作者與年份、其計分方法,以及背後的證據,包括該證據在哪些地方仍存在爭議。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。
- 篩檢並非診斷篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。