心理テストにおける妥当性とは
妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
妥当性とは、テストがそれが主張するものを測定しているかどうか、そしてその得点から人々が引き出す結論が正当なものであるかどうかを問うものです。これは心理測定学における中心的な問いであり、エビデンスではなくマーケティングの主張で答えられることが最も多い問いです。
1980年代のメシックの研究以来保持されている現代的な理解では、妥当性は測定器具の固定された属性ではありません。特定の用途のための得点の解釈の属性です。同じ質問紙が、ある人の自己認識を記述するためにはよく検証されていながら、その人を採用するかどうかの決定にはまったく検証されていないということがあり得ます。何に対して妥当かを述べずに「このテストは妥当です」と言うことは、主張ではなくスローガンです。
エビデンスの種類
妥当性は、いくつかの種類の蓄積されたエビデンスから構築されます。古いテキストではこれらを妥当性の別々の種として提示しますが、現在の見方では、単一のケースを支持する異なる論証として扱います。
内容エビデンスは、項目が構成概念を適切にカバーしているかどうかを問います。睡眠と食欲についてのみ尋ねるうつ病尺度は、身体症状をカバーし、気分と認知の症状を見逃しています。内容カバレッジは通常、主題の専門家によって判断されます。非常に短い尺度が常に妥協である理由がここにあります。
内部構造エビデンスは、項目が理論が述べる通りにグループ化されるかどうかを問います。モデルが4つの異なるファセットを主張するなら、因子分析は4つの因子を回復すべきです。そして重要なことに、尺度が構築されたデータだけでなく、独立した標本においてです。非常に多くの測定器具が開発標本では意図した構造を回復しながら、他のデータでは失敗します。
他の変数との関係は、ほとんどの作業が行われる場所です。収束的エビデンスは、尺度が相関すべきものと相関していることを示します。弁別的エビデンスは、異なるべきものと高すぎる相関を持たないことを示します。これは慢性的に軽視される要件であり、多くの新しくブランド化された構成概念を沈ませるものです。基準関連エビデンスは、得点が重要な結果と関連することを示します。同時に測定されるか、事前に予測されるかのいずれかです。
結果エビデンスは、テストが使用されたときに何が起こるかを問います。測定器具が構成概念とは無関係な理由であるグループを系統的に不利にするなら、それは倫理的な問題であるだけでなく、妥当性の問題です。
ほとんどの主張を露呈させる問い
妥当性の主張の最も鋭い検証は増分的妥当性です。この測定器具は、より安価で、より古い、確立された測定がすでに伝えていることに何かを追加するか。
驚くべき数のブランド化された構成概念がここで失敗します。既存のBig Fiveドメインとの相関が0.7以上であり、同じ大きさで同じ結果を予測し、古い測定を統計的に統制すると何も追加しません。構成概念は新しいですが、測定は新しくないのです。これが、真剣な測定器具文書の批判セクションが不正確さよりも冗長性をめぐることが非常に多い理由です。
何を確認すべきか
テストが検証されていると主張する人がいる場合、有用な質問は具体的なものです。どの基準に対して検証されたのか。どの集団で、どの規模で。因子構造は独立した標本で確認されたか。回答に商業的利益のない研究者による公開エビデンスはあるか。確立された代替案に対して何かを追加するか。
それらの質問に正直な答えを持つ測定器具は、限界を含めて真剣に受け止める価値があります。検証が推薦文のページと何百万人もの人が受けたという主張から成る測定器具は、まったく異なる質問に答えています。人気はエビデンスではなく、テストを受けた人の数はその得点が何かを意味するかどうかについて何も語りません。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。