篩檢並非診斷
篩檢問卷的設計目的是盡可能篩出所有可能的個案,並以較高的假陽性率作為代價。把篩檢得分當作診斷來解讀,恰恰違背了它原本的設計目的。
憂鬱症篩檢問卷、焦慮篩檢工具、酒精使用篩檢工具,都是現存最經過驗證的測驗之一,但卻經常被誤讀。得分高於切點,並不代表您患有該疾病。這從來就不是它的設計目的。
設計上的取捨
每一種篩檢工具都存在於兩種錯誤之間的取捨:漏掉真正患病的人,以及誤將未患病的人標記出來。篩檢工具刻意向後者傾斜。在基層醫療中漏掉一個憂鬱症案例代價高昂;而一個偽陽性的代價,只是與臨床人員的一次談話。
這個結果是算術上的必然。一個敏感度88%、特異度85%的篩檢工具聽起來十分優異。但若將其應用於實際患病率僅5%的族群,在每100位篩檢結果為陽性的人中,大約有74人其實並未患病。這個工具運作方式完全符合設計規格,但大多數陽性結果仍是偽陽性。
這就是基準率的算術問題,也是為什麼即使是經過充分驗證的測驗,在低患病率情境下實施全面篩檢仍具爭議的原因。
切點是什麼
切點是針對特定族群、為某個目的而選定的決策門檻,並非自然存在的界線。傳統PHQ-9的切點10分,是在患病率相對較高的族群中推導出來的;套用於其他情境時,表現便會不同。個體參與者資料的統合分析顯示,該切點所發表的準確度估計值,因選擇性報告經過優化的門檻而系統性地被誇大。
有些測驗刻意不設定通用切點。世界衛生組織的SRQ-20在數十個國家使用,其最佳門檻因國家、語言與性別而異,差異之大,使得公佈單一全球數字反而比交由各地自行驗證更有害。
診斷是另一套程序
診斷需要臨床人員確認症狀的存在與持續時間、其對功能的影響,並排除其他可能的解釋,例如生理疾病、物質使用,或其他表現相似的障礙。診斷會考量病史與情境脈絡。問卷則完全不做這些事,它只是計算在特定時間範圍內自我報告的症狀頻率。
兩個人可能因完全不同的臨床狀況,卻得出相同的分數,因為總分將多種異質性症狀壓縮成單一數字。得分只是一個提示,表示需要進一步了解。進一步了解的過程,才是診斷本身。
得分真正的用途
提示作用。 高分是與專業人員談話的理由。這正是其設計目的,也確實具有價值。
追蹤變化。 這是常被忽略的功能。在治療過程中重複測量,可以顯示某種療法是否有效,這比任何單一分數都更具資訊價值。以測量為基礎的照護模式,正是建立在這一點之上。
族群描述。 在研究與公共衛生領域,這些測驗用於估算群體間的症狀負擔,這正是它們最擅長的用途。
解讀您自己的結果
如果您在篩檢工具上的得分高於門檻,正確的理解是:這值得與具備資格的專業人員談一談。而不是:我患有這種疾病。
如果您的得分低於門檻,正確的理解是:這次篩檢並未標記出任何問題。而不是:我沒事。篩檢工具會漏掉真正的案例,這正是取捨的另一半,因此對於自覺不適的人來說,低分並不代表可以安心。
在NOESIS發布篩檢工具的地方,報告會註明已發表的門檻值、標明出處,並明確說明該結果並非診斷。這樣的說明並非法律形式上的例行文字,而是這些測驗本身對其用途所做出的說明。
付諸實測
閱讀關於測量的文章是一件事,親眼看到自己的得分連同其來源、常模樣本與限制一起呈現則是另一件事。免費進行測驗,無需註冊。
繼續閱讀
- 什麼是心理計量學?這門學科用來判斷一項心理測量是否可靠,也正是為什麼兩份問題相似的測驗,其結果的價值卻可能天差地別的原因。
- 心理測驗中的信度是什麼?信度指的是測量的一致性,而非正確性。一項測驗可以擁有極高的信度,卻仍然測量到錯誤的事物,這正是為什麼信度永遠是第一個被提出的問題,而不會是最後一個。
- 什麼是心理測驗中的效度?效度並非測驗本身具備的特性,而是一種論證:針對特定用途,對特定得分的特定解釋是否站得住腳。而且每次新的使用情境都必須重新建立這項論證。
- 什麼是建構效度?測量中最難回答的問題是:你所測量的事物,是否真的以你所定義的方式存在,以及你的測量工具是否確實測到了它,而不是測到與它相近的其他事物。
- 聚合效度與區辨效度兩項互為鏡像的要求:一項測量工具必須與它應該相符的事物相符,同時必須與它宣稱不是的事物保持區別。大多數效度薄弱的測驗工具在第二項上就會失敗。
- 什麼是 Cronbach's alpha,以及它不是什麼這是心理測驗中最常被報告的統計數據,也是最常被誤讀的一項。Alpha係數並不能告訴你一個量表是單一維度的,而高數值往往是問題的徵兆,而非優點。
- 測量標準誤:您的得分可能存在的誤差範圍每一個得分都帶有誤差範圍,而對大多數心理測驗而言,這個範圍比人們以為的更大。這正是告訴你一項差異究竟是真實存在,還是只是噪音的關鍵數字。
- 常模與百分位數:您的得分是與什麼進行比較原始得分本身無法單獨解讀,只有對照參照群體才能產生意義。而所使用的是哪一個參照群體,正是任何測驗中最具影響力、卻最少被公開說明的事實之一。
- 心理測驗實際上是如何建構的從構念定義到常模的公布,整個流程需要耗費數年,並且會捨棄大部分投入其中的內容。了解這些步驟,就能清楚看出一份快速的線上測驗略過了哪些環節。
- 當一項測驗被稱為「已驗證」時,這代表什麼意思?這個詞沒有受到規範,任何未曾做過相關功夫的產品都能自由使用它。以下說明這個詞在真正有意義時代表什麼,以及能區分兩種情況的四個問題。
- 為什麼大多數網路人格測驗不可靠並非因為他們不誠實,而是因為讓一項測量值得信賴的步驟,往往隱而不顯、成本高昂,且容易被略過。而略過這些步驟,並不會改變結果看起來的樣子。
- 自陳量表能測量與不能測量的範圍問卷要求你成為自己的觀察者,這種方法對某些事物的效果比其他事物更好。了解這種方法在哪些方面表現優異、在哪些方面會失效,將改變你解讀任何結果的方式。
- 當一份測驗能夠預測某件事時,這代表什麼意思相關係數0.30在人格研究中是強而有力的發現,但作為針對單一個人的決策依據卻十分薄弱。這兩種說法都成立,而兩者之間的差距正是造成大多數測驗結果誤用的原因。