スクリーニングは診断ではない
スクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。
うつ病のスクリーニング質問紙、不安のスクリーナー、アルコール使用のスクリーナー。これらは現存する最もよく検証された測定器具の中に含まれていますが、日常的に誤読されています。カットオフを超える得点は、その状態を持っていることを意味しません。そのように設計されたことは一度もありません。
設計上のトレードオフ
すべてのスクリーニング器具は、2つの誤りの間のトレードオフの上にあります。状態を持つ人を見逃すことと、持たない人にフラグを立てることです。スクリーニングツールは意図的に後者に偏るよう調整されています。プライマリケアでうつ病の症例を見逃すことはコストが大きいですが、偽陽性のコストは臨床医との対話一回分です。
帰結は算術的に導かれます。感度88%、特異度85%のスクリーナーは優秀に聞こえます。しかし、実際に状態を持つ人が5%の集団に適用すると、陽性とスクリーニングされた100人のうち、約74人はその状態を持っていません。測定器具は仕様通りに正確に機能しています。それでも陽性の大部分は偽です。
これは基準率の算術であり、低有病率の環境における一律スクリーニングが、よく検証された測定器具であっても論争の対象である理由です。
カットオフとは何か
カットオフは、ある集団におけるある目的のために選ばれた決定閾値であり、自然な境界ではありません。PHQ-9の慣例的なカットオフ10は、比較的高い有病率の集団で導出されました。他の場所に適用すると異なる振る舞いをします。個人参加者メタ分析は、そのカットオフの公表された精度推定値が、最適化された閾値の選択的報告によって系統的に膨張していたことを示しています。
一部の測定器具では、意図的に普遍的なカットオフがまったく存在しません。世界保健機関のSRQ-20は数十カ国で使用されており、その最適閾値は国、言語、性別によって十分に異なるため、1つのグローバルな数値を公開することは、地域の検証に委ねるよりも有害です。
診断は異なる手続きである
診断には、臨床医が症状の存在と持続期間、機能への影響、および代替的説明(医学的状態、物質、類似して現れる他の障害)の除外を確立することが必要です。病歴と文脈を考慮します。質問紙はこれらのいずれも行いません。ある期間にわたる自己報告された症状頻度を数えるだけです。
2人の人が、まったく異なる臨床像からまったく同じ得点を出すことがあり得ます。合計得点がいくつかの異質な症状を1つの数値に圧縮するからです。得点はさらに調べるべきシグナルであり、その調べることが診断です。
得点の正当な用途
きっかけ。 高い得点は、専門家に相談する理由です。それが意図された用途であり、真に価値のあるものです。
変化の追跡。 これは過小利用されている機能です。治療の経過における繰り返しの測定は、何かが効いているかどうかを示し、いかなる単一の得点よりもはるかに情報的です。測定に基づくケアはこの上に構築されています。
集団の記述。 研究と公衆衛生において、これらの測定器具はグループ全体の症状負荷を推定します。これが最も得意とするところです。
自分の結果を読む
スクリーナーで閾値を超えた場合、正しい解釈は、これは資格のある人との対話が必要であるということです。この状態を持っているということではありません。
閾値を下回った場合、正しい解釈は、この特定のスクリーニングは何もフラグを立てなかったということです。大丈夫だということではありません。スクリーナーは症例を見逃すことがあり、それがトレードオフのもう半分です。気分が悪い人の低い得点は安心材料にはなりません。
NOESISがスクリーニング器具を公開する場合、レポートは公開された閾値を明示し、出典を挙げ、結果は診断ではないと明確に述べています。この枠組みは法的な形式ではなく、測定器具自身がその使用について述べていることです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。